OpenAI 用过程监督提升模型数学推理能力
OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。
推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。
OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。
推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。
OpenAI 使用 GPT-4 自动为大语言模型中神经元的行为撰写解释并进行评分,并发布了涵盖 GPT-2 每个神经元的解释与评分数据集。OpenAI 说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并评分 GPT-2 神经元行为并开源数据,为可解释性研究提供了可复用的方法思路。
OpenAI 发布论文 GPTs are GPTs,初步评估大语言模型对美国劳动力市场的潜在影响。因抓取失败仅有标题,具体结论以原文为准。
Hugging Face 发布 MTEB(Massive Text Embedding Benchmark),用于衡量文本嵌入模型在多种任务上的表现,排行榜已汇总超过 2000 个结果。
OpenAI 发布 VPT(Video PreTraining)方法,利用大规模无标注人类 Minecraft 游玩视频加少量标注承包商数据训练神经网络。经微调后模型可制作钻石工具,该任务熟练人类通常需超过 20 分钟(约 24,000 个操作),模型使用键鼠原生人类接口,被视为迈向通用计算机使用智能体的一步。
推荐理由:原文介绍了用少量标注数据加大规模无标注视频预训练的思路,对理解视频数据训练智能体方法有参考价值。
OpenAI 训练了“批评写作”模型,用于指出 AI 总结中存在的缺陷。人类评估者在看到模型批评后,能更频繁地发现总结中的问题,且模型规模越大自我批评能力越强,批评写作能力的提升比总结写作更明显。这一结果表明 AI 系统有望辅助人类监督 AI 完成困难任务。
微软团队提出 TAPEX,通过在合成 SQL 查询及其执行结果上学习神经 SQL 执行器来完成表格预训练,无需真实数据。
当一个度量指标成为优化目标时,它就不再是好的度量——这正是 OpenAI 在优化那些难以或高成本测量的目标时必须面对的 Goodhart 定律难题。
OpenAI 发布论文 Hierarchical text-conditional image generation with CLIP latents,介绍使用 CLIP latents 进行分层文本条件图像生成的方法。材料仅标题可用,正文未抓取到。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能解多种有挑战性的高中奥赛题,包括 AMC12 和 AIME 竞赛题,以及两道由 IMO 改编的题目。
OpenAI 发布题为 Text and code embeddings by contrastive pre-training 的文章,介绍通过对比预训练得到的文本与代码嵌入。原文抓取失败,仅标题可用,详情需查看 https://openai.com/index/text-and-code-embeddings-by-contrastive-pre-training。
OpenAI 训练了一个求解小学数学应用题的系统,准确率接近微调 GPT-3 模型的两倍。在同一批测试题上,9-12 岁儿童小样本得分为 60%,该系统得分为 55%,约达到真实儿童解题量的 90%。
OpenAI 发布通过人类反馈扩展 AI 系统人类监督的研究,针对难以评估的任务训练书籍摘要模型。原文仅提供一句话摘要,未给出更多实验细节。
Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 分布式协作训练方法,可自适应参与者的网络与硬件条件。该方法由 40 名志愿者协同预训练了孟加拉语模型 sahajBERT(约 18M 参数,基于 ALBERT),在 NER 上 F1 达 95.45、NCC 准确率 91.97,结果与数百块 V100 训练的 XLM-R-large 相当。
推荐理由:原文给出 DeDLOC 协作训练方法细节和 40 名志愿者预训练 sahajBERT 的实测结果,含下游任务对比数据,方法可复用。
OpenAI 发表论文《Evaluating large language models trained on code》,主题为评估基于代码训练的大语言模型。抓取仅获取到标题,正文内容不可用。
OpenAI 最新研究发现,通过在一个小规模精选数据集上进行微调,可以改善语言模型在特定行为价值观方面的表现。
Hugging Face 2021年2月阅读小组聚焦长序列 Transformer 的注意力效率问题,重点解读四篇论文:Longformer(定制注意力模式)、Compressive Transformer(循环机制)、Linformer(低秩近似)和 Performer(核近似)。
OpenAI 发现在 CLIP 中存在对同一概念产生响应的神经元,无论该概念以字面、符号或概念形式呈现。这一现象可能解释了 CLIP 在对概念的出人意料的视觉表现形式进行分类时的准确性,也是理解 CLIP 及类似模型所学习的关联与偏差的重要一步。
推荐理由:原文指出了 CLIP 中多模态神经元的存在及其对理解模型学习关联与偏差的意义。
OpenAI 应用人类反馈的强化学习(RLHF)训练出在摘要任务上表现更好的语言模型。
第三届 OpenAI Scholars 学员在线上 Demo Day 展示了结业项目,呈现过去五个月的研究成果。
OpenAI 发布 Image GPT,将与语言模型相同架构的 Transformer 训练在像素序列上,可生成连贯的图像补全和样本。研究建立了生成样本质量与图像分类精度之间的相关性,其最佳生成模型在无监督设置下提取的特征可与顶级卷积网络竞争。
OpenAI 发布题为 Language Models are Few-Shot Learners 的论文,提出语言模型可作为少样本学习者。原文正文抓取失败,仅标题可用,更多细节以原文链接 https://openai.com/index/language-models-are-few-shot-learners 为准。
OpenAI 发布分析指出,自 2012 年以来在 ImageNet 分类上达到相同性能所需的训练算力每 16 个月减少一半。相比 2012 年,如今训练到 AlexNet 水平所需算力减少 44 倍,而 Moore's Law 同期只能带来 11 倍的成本改善。作者据此认为,在高投入的 AI 任务上,算法进步带来的收益已超过传统硬件效率提升。
推荐理由:原文量化了算法进步带来的算力节省速度,可与 Moore's Law 对比,帮助理解硬件与算法效率的真实差距。
OpenAI 参与了一份由 30 家机构、58 位作者共同撰写的多方报告,提出 10 项机制用于提升 AI 系统相关声明的可验证性。报告由未来智能研究中心、Mila 等机构参与完成。开发者可借助这些机制提供 AI 系统安全、公平或隐私保护的证据,用户、政策制定者和公民社会也可用来评估 AI 开发流程。
OpenAI 发表关于神经语言模型缩放定律的研究,原文正文抓取失败,仅标题可用。
OpenAI 发布关于 Dota 2 大规模深度强化学习的文章。材料抓取失败,仅标题可用,正文细节无法确认。
OpenAI 发现双重下降(double descent)现象广泛存在于 CNN、ResNets 和 Transformers 中:随着模型规模、数据量或训练时间增加,性能先提升、再下降、随后再次提升。通过仔细的正则化通常可以避免这一效应。该现象目前尚无完整解释,OpenAI 认为对其进一步研究是重要方向。
OpenAI 发布 Procgen Benchmark,包含 16 个简单易用的程序化生成环境,可直接衡量强化学习智能体学习可泛化技能的速度。该基准可用于评估智能体的泛化能力。
OpenAI 训练了一对神经网络,用仿人机器手还原魔方,训练完全在仿真中进行,采用与 OpenAI Five 相同的强化学习代码和新技术 Automatic Domain Randomization(ADR)。系统能应对训练中未见过的情况,例如被长颈鹿玩偶戳动,表明强化学习可解决需要极高灵巧度的现实物理问题。
推荐理由:原文说明神经网络完全在仿真中训练即可操控机械手还原魔方,并给出 ADR 这一可迁移到其他物理任务的方法。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多种任务上成功匹配外部人工标注者的偏好。摘要任务用了 6 万条人工标注,简单的续写风格任务只需 5 千条;标注者的偏好并非总与团队一致,例如摘要标注者偏好整句照抄原文,模型随之学会了照抄。OpenAI 表示此举旨在让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:原文给出了用人类偏好微调 GPT-2 的任务效果、标注成本与偏好偏差实例,可了解早期 RLHF 实践细节。
OpenAI 报告,智能体在其新构建的模拟捉迷藏环境中训练时逐步发现了更复杂的工具使用。智能体建立了六种不同的策略与反制策略,其中一些是团队此前不知道环境所支持的;这种自监督的涌现复杂性表明多智能体协同适应或能产生极为复杂和智能的行为。
推荐理由:原文报告了多智能体博弈中自发涌现工具使用的观察,对理解智能体协同演化行为的读者有背景价值。
OpenAI 开发了一种评估神经网络分类器能否可靠抵御训练时未见的对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness)。该指标用于衡量单个模型面对未预期攻击的鲁棒性,并强调需要在更多样化的未知攻击上测量模型性能。
OpenAI 开发出 Sparse Transformer,一种在文本、图像和声音等序列预测任务上创造新纪录的深度神经网络。它通过对注意力机制的算法改进,可从比以往长 30 倍的序列中提取模式。
OpenAI 在能量模型(EBM)的稳定、可扩展训练上取得进展,样本质量与泛化能力优于现有模型。EBM 生成时通过持续细化答案投入更多算力,在低温下可生成与 GAN 相当的样本,同时具备似然类模型的 mode 覆盖保证。
OpenAI 与 Google 研究者合作创建了 Activation Atlases,一种可视化神经元之间交互所能表示内容的新技术。随着 AI 系统被部署到越来越敏感的场景,更好地理解其内部决策过程有助于发现弱点并调查故障。
OpenAI 发表论文指出,长期 AI 安全研究需要社会科学家参与,才能确保对齐算法在真实人类参与时发挥作用。让先进 AI 系统与人类价值观对齐,需解决人类理性、情感与偏见心理学中的诸多不确定性。OpenAI 希望推动机器学习与社会科学研究者合作,并计划全职招聘社会科学家。
OpenAI 发现梯度噪声规模(gradient noise scale)这一统计指标可预测神经网络训练在多种任务上的可并行性。复杂任务梯度更嘈杂,未来更大的 batch size 可能变得有用,从而移除 AI 系统继续扩大的一个潜在限制;研究还表明神经网络训练可以被严格化和系统化。
OpenAI 发布 CoinRun 训练环境,为智能体将经验迁移到新情境的能力提供量化指标,并已帮助厘清强化学习中一个长期存在的难题。CoinRun 的复杂度介于传统平台游戏(如 Sonic the Hedgehog)与更低难度环境之间,同时对最先进算法仍构成有价值的泛化挑战。
OpenAI 开发出一种能量模型,只需五个演示即可快速学会识别和生成 near、above、between、closest、furthest 等以二维点集表达的概念。该模型还展现出跨域迁移能力:在二维粒子环境中学到的概念可被用于求解三维物理仿真机器人上的任务。
OpenAI 提出 Random Network Distillation(RND),一种通过好奇心鼓励强化学习智能体探索环境的基于预测的奖励方法。该方法在 Montezuma's Revenge 上首次超过人类平均水平。