OpenAI 的 Consistency Models 研究
Consistency Models 是 OpenAI 发布的一项生成模型研究,针对扩散模型的问题提出改进。扩散模型虽显著推进了图像、音频和视频生成,但其依赖的迭代采样过程导致生成速度慢。
Consistency Models 是 OpenAI 发布的一项生成模型研究,针对扩散模型的问题提出改进。扩散模型虽显著推进了图像、音频和视频生成,但其依赖的迭代采样过程导致生成速度慢。
OpenAI 提出一种整体化方法,用于构建健壮且实用的自然语言分类系统,服务真实世界的内容审核场景。该方案聚焦undesired content(不良内容)检测的实际落地,兼顾系统稳健性与可用性。
OpenAI 使用新的稀疏自编码器扩展技术,自动识别出 GPT-4 计算过程中的 1600 万个模式。
推荐理由:OpenAI 用稀疏自编码器扩展技术从 GPT-4 中提取 1600 万个模式,关注可解释性方向的读者可以了解其规模化路径。
Meta 发布开源评测框架 CyberSecEval 2,用于评估 LLM 在生成不安全代码、提示词注入、协助网络攻击、代码解释器滥用和自动化攻击能力等方面的安全风险。评测显示,LLM 平均协助网络攻击的合规率已从上一版的 52% 降至 28%;提示词注入防护仍未解决,模型在端到端漏洞利用上能力有限。全部代码开源,并提供 leaderboard,欢迎社区贡献。
Hugging Face 发布 JAT,一个基于 Transformer 的多用途智能体项目,包含 Gato 的开放复现:发布了覆盖 Atari、BabyAI、Meta-World、MuJoCo 等环境的大量专家 RL 智能体、首个通用智能体训练数据集 JAT dataset(含数十万条专家轨迹)以及可玩电子游戏、控制机器人、执行导航指令的 JAT 模型。
OpenAI 发布关于指令分层(instruction hierarchy)的工作,目标是训练 LLM 优先处理特权指令。原文指出当前 LLM 易受提示词注入、越狱等攻击,攻击者可用恶意提示词覆盖模型的原始指令。
推荐理由:原文说明指令分层的动机,指出大语言模型易受提示词注入和越狱攻击的问题背景。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
Secure Learning Lab 在 Hugging Face 上发布了新的 LLM Safety Leaderboard,专注于大语言模型安全评估,由 HF leaderboard template 驱动。
OpenAI 提出 superalignment 新研究方向,探讨能否利用深度学习的泛化性质,用弱监督者控制强模型。官方表示已获得有希望的初步结果,该方向指向未来超人类水平模型的对齐问题。
Hugging Face 扩展 Open LLM Leaderboard,用 Scale AI 人类标注与 GPT-4 对 Koala-13B、Vicuna-13B、OpenAssistant-12b、Dolly-12b 在 327 条提示的盲测集上做偏好对比,并构建带误差估计的 Elo 排名。
OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。
推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。
OpenAI 使用 GPT-4 自动为大语言模型中神经元的行为撰写解释并进行评分,并发布了涵盖 GPT-2 每个神经元的解释与评分数据集。OpenAI 说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并评分 GPT-2 神经元行为并开源数据,为可解释性研究提供了可复用的方法思路。
OpenAI 发布论文 GPTs are GPTs,初步评估大语言模型对美国劳动力市场的潜在影响。因抓取失败仅有标题,具体结论以原文为准。
Hugging Face 发布 MTEB(Massive Text Embedding Benchmark),用于衡量文本嵌入模型在多种任务上的表现,排行榜已汇总超过 2000 个结果。
OpenAI 发布 VPT(Video PreTraining)方法,利用大规模无标注人类 Minecraft 游玩视频加少量标注承包商数据训练神经网络。经微调后模型可制作钻石工具,该任务熟练人类通常需超过 20 分钟(约 24,000 个操作),模型使用键鼠原生人类接口,被视为迈向通用计算机使用智能体的一步。
推荐理由:原文介绍了用少量标注数据加大规模无标注视频预训练的思路,对理解视频数据训练智能体方法有参考价值。
OpenAI 训练了“批评写作”模型,用于指出 AI 总结中存在的缺陷。人类评估者在看到模型批评后,能更频繁地发现总结中的问题,且模型规模越大自我批评能力越强,批评写作能力的提升比总结写作更明显。这一结果表明 AI 系统有望辅助人类监督 AI 完成困难任务。
微软团队提出 TAPEX,通过在合成 SQL 查询及其执行结果上学习神经 SQL 执行器来完成表格预训练,无需真实数据。
当一个度量指标成为优化目标时,它就不再是好的度量——这正是 OpenAI 在优化那些难以或高成本测量的目标时必须面对的 Goodhart 定律难题。
OpenAI 发布论文 Hierarchical text-conditional image generation with CLIP latents,介绍使用 CLIP latents 进行分层文本条件图像生成的方法。材料仅标题可用,正文未抓取到。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能解多种有挑战性的高中奥赛题,包括 AMC12 和 AIME 竞赛题,以及两道由 IMO 改编的题目。
OpenAI 发布题为 Text and code embeddings by contrastive pre-training 的文章,介绍通过对比预训练得到的文本与代码嵌入。原文抓取失败,仅标题可用,详情需查看 https://openai.com/index/text-and-code-embeddings-by-contrastive-pre-training。
OpenAI 训练了一个求解小学数学应用题的系统,准确率接近微调 GPT-3 模型的两倍。在同一批测试题上,9-12 岁儿童小样本得分为 60%,该系统得分为 55%,约达到真实儿童解题量的 90%。
OpenAI 发布通过人类反馈扩展 AI 系统人类监督的研究,针对难以评估的任务训练书籍摘要模型。原文仅提供一句话摘要,未给出更多实验细节。
Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 分布式协作训练方法,可自适应参与者的网络与硬件条件。该方法由 40 名志愿者协同预训练了孟加拉语模型 sahajBERT(约 18M 参数,基于 ALBERT),在 NER 上 F1 达 95.45、NCC 准确率 91.97,结果与数百块 V100 训练的 XLM-R-large 相当。
推荐理由:原文给出 DeDLOC 协作训练方法细节和 40 名志愿者预训练 sahajBERT 的实测结果,含下游任务对比数据,方法可复用。
OpenAI 发表论文《Evaluating large language models trained on code》,主题为评估基于代码训练的大语言模型。抓取仅获取到标题,正文内容不可用。
OpenAI 最新研究发现,通过在一个小规模精选数据集上进行微调,可以改善语言模型在特定行为价值观方面的表现。
Hugging Face 2021年2月阅读小组聚焦长序列 Transformer 的注意力效率问题,重点解读四篇论文:Longformer(定制注意力模式)、Compressive Transformer(循环机制)、Linformer(低秩近似)和 Performer(核近似)。
OpenAI 发现在 CLIP 中存在对同一概念产生响应的神经元,无论该概念以字面、符号或概念形式呈现。这一现象可能解释了 CLIP 在对概念的出人意料的视觉表现形式进行分类时的准确性,也是理解 CLIP 及类似模型所学习的关联与偏差的重要一步。
推荐理由:原文指出了 CLIP 中多模态神经元的存在及其对理解模型学习关联与偏差的意义。
OpenAI 应用人类反馈的强化学习(RLHF)训练出在摘要任务上表现更好的语言模型。
第三届 OpenAI Scholars 学员在线上 Demo Day 展示了结业项目,呈现过去五个月的研究成果。
OpenAI 发布 Image GPT,将与语言模型相同架构的 Transformer 训练在像素序列上,可生成连贯的图像补全和样本。研究建立了生成样本质量与图像分类精度之间的相关性,其最佳生成模型在无监督设置下提取的特征可与顶级卷积网络竞争。
OpenAI 发布题为 Language Models are Few-Shot Learners 的论文,提出语言模型可作为少样本学习者。原文正文抓取失败,仅标题可用,更多细节以原文链接 https://openai.com/index/language-models-are-few-shot-learners 为准。
OpenAI 发布分析指出,自 2012 年以来在 ImageNet 分类上达到相同性能所需的训练算力每 16 个月减少一半。相比 2012 年,如今训练到 AlexNet 水平所需算力减少 44 倍,而 Moore's Law 同期只能带来 11 倍的成本改善。作者据此认为,在高投入的 AI 任务上,算法进步带来的收益已超过传统硬件效率提升。
推荐理由:原文量化了算法进步带来的算力节省速度,可与 Moore's Law 对比,帮助理解硬件与算法效率的真实差距。
OpenAI 参与了一份由 30 家机构、58 位作者共同撰写的多方报告,提出 10 项机制用于提升 AI 系统相关声明的可验证性。报告由未来智能研究中心、Mila 等机构参与完成。开发者可借助这些机制提供 AI 系统安全、公平或隐私保护的证据,用户、政策制定者和公民社会也可用来评估 AI 开发流程。
OpenAI 发表关于神经语言模型缩放定律的研究,原文正文抓取失败,仅标题可用。
OpenAI 发布关于 Dota 2 大规模深度强化学习的文章。材料抓取失败,仅标题可用,正文细节无法确认。
OpenAI 发现双重下降(double descent)现象广泛存在于 CNN、ResNets 和 Transformers 中:随着模型规模、数据量或训练时间增加,性能先提升、再下降、随后再次提升。通过仔细的正则化通常可以避免这一效应。该现象目前尚无完整解释,OpenAI 认为对其进一步研究是重要方向。
OpenAI 发布 Procgen Benchmark,包含 16 个简单易用的程序化生成环境,可直接衡量强化学习智能体学习可泛化技能的速度。该基准可用于评估智能体的泛化能力。
OpenAI 训练了一对神经网络,用仿人机器手还原魔方,训练完全在仿真中进行,采用与 OpenAI Five 相同的强化学习代码和新技术 Automatic Domain Randomization(ADR)。系统能应对训练中未见过的情况,例如被长颈鹿玩偶戳动,表明强化学习可解决需要极高灵巧度的现实物理问题。
推荐理由:原文说明神经网络完全在仿真中训练即可操控机械手还原魔方,并给出 ADR 这一可迁移到其他物理任务的方法。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多种任务上成功匹配外部人工标注者的偏好。摘要任务用了 6 万条人工标注,简单的续写风格任务只需 5 千条;标注者的偏好并非总与团队一致,例如摘要标注者偏好整句照抄原文,模型随之学会了照抄。OpenAI 表示此举旨在让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:原文给出了用人类偏好微调 GPT-2 的任务效果、标注成本与偏好偏差实例,可了解早期 RLHF 实践细节。