跳到正文

全部动态

今日 1 条
3月20日周三
  1. Hugging Face Blog60

    Hugging Face 发布 Cosmopedia:详解如何为预训练大语言模型生成大规模合成数据

    Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。

    推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。

3月15日周五
3月5日周二
2月20日周二
2月2日周五
1月31日周三
1月29日周一
1月26日周五
12月14日周四
12月1日周五
  1. Hugging Face Blog54

    Hugging Face 排查 Open LLM Leaderboard 中 DROP 评测分数异常并暂时移除该基准

    Hugging Face 宣布从 Open LLM Leaderboard 中移除 DROP 基准,原因是多数模型 f1 分数异常低于 10。排查发现归一化步骤会漏掉后接非空格空白字符的数字,且以句号作为生成结束符会截断浮点答案并拉低高质量模型分数;按换行符重切分后分数与整体表现相关性明显改善。团队在与 EleutherAI 讨论后决定待新版本评测开发完成前先移除 DROP,并邀请社区反馈。

6月23日周五
6月12日周一
5月31日周三
  1. OpenAI News67

    OpenAI 用过程监督提升模型数学推理能力

    OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。

    推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。

5月24日周三
3月17日周五
1月11日周三
  1. OpenAI News48

    OpenAI 联合 Georgetown 与 Stanford 研究大语言模型在虚假信息活动中的潜在滥用及风险缓解

    OpenAI 与 Georgetown University 安全与新兴技术中心、Stanford Internet Observatory 合作,研究大语言模型可能被滥用于虚假信息活动的风险。双方于 2021 年 10 月举办了一场汇聚 30 名虚假信息研究者、机器学习专家和政策分析师的工作坊,并在一年多研究基础上共同发布报告。报告概述了语言模型对信息环境的威胁,并提出分析缓解措施的框架。

10月19日周三
6月23日周四
  1. OpenAI News64

    OpenAI 用 Video PreTraining 训练神经网络玩 Minecraft

    OpenAI 发布 VPT(Video PreTraining)方法,利用大规模无标注人类 Minecraft 游玩视频加少量标注承包商数据训练神经网络。经微调后模型可制作钻石工具,该任务熟练人类通常需超过 20 分钟(约 24,000 个操作),模型使用键鼠原生人类接口,被视为迈向通用计算机使用智能体的一步。

    推荐理由:原文介绍了用少量标注数据加大规模无标注视频预训练的思路,对理解视频数据训练智能体方法有参考价值。

6月13日周一
5月23日周一
4月13日周三
1月24日周一
10月29日周五
9月23日周四
7月15日周四
  1. Hugging Face Blog61

    Hugging Face 发布 DeDLOC 协作训练方法并用 40 名志愿者预训练 sahajBERT

    Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 分布式协作训练方法,可自适应参与者的网络与硬件条件。该方法由 40 名志愿者协同预训练了孟加拉语模型 sahajBERT(约 18M 参数,基于 ALBERT),在 NER 上 F1 达 95.45、NCC 准确率 91.97,结果与数百块 V100 训练的 XLM-R-large 相当。

    推荐理由:原文给出 DeDLOC 协作训练方法细节和 40 名志愿者预训练 sahajBERT 的实测结果,含下游任务对比数据,方法可复用。

7月7日周三
6月10日周四
3月9日周二
3月4日周四
  1. OpenAI News65

    OpenAI 发现 CLIP 中的多模态神经元

    OpenAI 发现在 CLIP 中存在对同一概念产生响应的神经元,无论该概念以字面、符号或概念形式呈现。这一现象可能解释了 CLIP 在对概念的出人意料的视觉表现形式进行分类时的准确性,也是理解 CLIP 及类似模型所学习的关联与偏差的重要一步。

    推荐理由:原文指出了 CLIP 中多模态神经元的存在及其对理解模型学习关联与偏差的意义。

9月4日周五
7月9日周四
6月17日周三
4月16日周四
  1. OpenAI News41

    OpenAI 参与多方报告:提出 10 项机制提升 AI 开发可验证性

    OpenAI 参与了一份由 30 家机构、58 位作者共同撰写的多方报告,提出 10 项机制用于提升 AI 系统相关声明的可验证性。报告由未来智能研究中心、Mila 等机构参与完成。开发者可借助这些机制提供 AI 系统安全、公平或隐私保护的证据,用户、政策制定者和公民社会也可用来评估 AI 开发流程。

1月23日周四
12月5日周四
12月3日周二
9月19日周四
  1. OpenAI News74

    OpenAI 用人类偏好微调 774M 参数 GPT-2

    OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多种任务上成功匹配外部人工标注者的偏好。摘要任务用了 6 万条人工标注,简单的续写风格任务只需 5 千条;标注者的偏好并非总与团队一致,例如摘要标注者偏好整句照抄原文,模型随之学会了照抄。OpenAI 表示此举旨在让安全技术更接近“机器与人对话”这一通用任务。

    推荐理由:原文给出了用人类偏好微调 GPT-2 的任务效果、标注成本与偏好偏差实例,可了解早期 RLHF 实践细节。

9月17日周二
  1. OpenAI News73

    OpenAI 观察到多智能体捉迷藏中自发涌现工具使用

    OpenAI 报告,智能体在其新构建的模拟捉迷藏环境中训练时逐步发现了更复杂的工具使用。智能体建立了六种不同的策略与反制策略,其中一些是团队此前不知道环境所支持的;这种自监督的涌现复杂性表明多智能体协同适应或能产生极为复杂和智能的行为。

    推荐理由:原文报告了多智能体博弈中自发涌现工具使用的观察,对理解智能体协同演化行为的读者有背景价值。

8月22日周四
7月10日周三