Hugging Face 发布 Cosmopedia:详解如何为预训练大语言模型生成大规模合成数据
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。
Hugging Face 发布开源数据集 WebSight,用于训练视觉语言模型将网页截图转换为 HTML 代码。其最新版 WebSight-v0.2 扩展至 200 万个样本,改用真实图像和 Tailwind CSS。基于该数据集微调的模型 Sightseer 可将截图转为可运行的 HTML,并能在生成代码中嵌入与原图相近的图像。
UCLA 研究者发布 ConTextual 基准,包含 506 条指令,覆盖时间读取、导航、信息图等 8 类富文本视觉场景,用于评估多模态模型对文字与图像的上下文联合推理能力,并附带排行榜。
Upstage 于 2023 年 9 月在 Hugging Face 上推出 Open Ko-LLM Leaderboard,构建韩语 LLM 评估生态。该排行榜采用 Ko-MMLU、Ko-ARC、Ko-HellaSwag、Ko-Truthful QA、Ko-CommonGEN V2 五项韩语基准,并采用不公开的私有测试集以防污染。
密歇根大学和罗格斯大学研究团队推出 NPHardEval 排行榜,通过基于计算复杂度类的 900 道算法题(覆盖 P、NP-complete、NP-hard 共 9 种算法、10 个难度级别)评估 LLM 推理能力。
OpenAI 正在开发一套评估大语言模型可能助力生物威胁创建风险的框架,在包含生物学专家和学生的评测中,GPT-4 对生物威胁创建准确率的提升最多仅为轻微(mild uplift)。该提升幅度尚不足以得出确定性结论,但这一发现为后续研究和社区讨论提供了起点。
Hugging Face 推出开源的 Hallucinations Leaderboard,通过上下文学习(in-context learning)在多个幻觉相关基准上评估大语言模型的可靠性。
Secure Learning Lab 在 Hugging Face 上发布了新的 LLM Safety Leaderboard,专注于大语言模型安全评估,由 HF leaderboard template 驱动。
OpenAI 提出 superalignment 新研究方向,探讨能否利用深度学习的泛化性质,用弱监督者控制强模型。官方表示已获得有希望的初步结果,该方向指向未来超人类水平模型的对齐问题。
Hugging Face 宣布从 Open LLM Leaderboard 中移除 DROP 基准,原因是多数模型 f1 分数异常低于 10。排查发现归一化步骤会漏掉后接非空格空白字符的数字,且以句号作为生成结束符会截断浮点答案并拉低高质量模型分数;按换行符重切分后分数与整体表现相关性明显改善。团队在与 EleutherAI 讨论后决定待新版本评测开发完成前先移除 DROP,并邀请社区反馈。
Hugging Face 团队调查 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数低于论文报告值的原因,发现同一 MMLU 数据集存在 Original、HELM 和 EleutherAI Harness 三种实现。
Hugging Face 扩展 Open LLM Leaderboard,用 Scale AI 人类标注与 GPT-4 对 Koala-13B、Vicuna-13B、OpenAssistant-12b、Dolly-12b 在 327 条提示的盲测集上做偏好对比,并构建带误差估计的 Elo 排名。
OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。
推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持 4bit 量化加载,并集成 Dettmers 等人新提出的 QLoRA 微调方法。
推荐理由:官方详细讲解 transformers 中 4bit 量化和 QLoRA 的用法与配置,附带在消费级 GPU 上微调 Llama 7B/13B 的实测结果。
OpenAI 发布论文 GPTs are GPTs,初步评估大语言模型对美国劳动力市场的潜在影响。因抓取失败仅有标题,具体结论以原文为准。
OpenAI 与 Georgetown University 安全与新兴技术中心、Stanford Internet Observatory 合作,研究大语言模型可能被滥用于虚假信息活动的风险。双方于 2021 年 10 月举办了一场汇聚 30 名虚假信息研究者、机器学习专家和政策分析师的工作坊,并在一年多研究基础上共同发布报告。报告概述了语言模型对信息环境的威胁,并提出分析缓解措施的框架。
Hugging Face 发布 MTEB(Massive Text Embedding Benchmark),用于衡量文本嵌入模型在多种任务上的表现,排行榜已汇总超过 2000 个结果。
OpenAI 发布 VPT(Video PreTraining)方法,利用大规模无标注人类 Minecraft 游玩视频加少量标注承包商数据训练神经网络。经微调后模型可制作钻石工具,该任务熟练人类通常需超过 20 分钟(约 24,000 个操作),模型使用键鼠原生人类接口,被视为迈向通用计算机使用智能体的一步。
推荐理由:原文介绍了用少量标注数据加大规模无标注视频预训练的思路,对理解视频数据训练智能体方法有参考价值。
OpenAI 训练了“批评写作”模型,用于指出 AI 总结中存在的缺陷。人类评估者在看到模型批评后,能更频繁地发现总结中的问题,且模型规模越大自我批评能力越强,批评写作能力的提升比总结写作更明显。这一结果表明 AI 系统有望辅助人类监督 AI 完成困难任务。
微软团队提出 TAPEX,通过在合成 SQL 查询及其执行结果上学习神经 SQL 执行器来完成表格预训练,无需真实数据。
当一个度量指标成为优化目标时,它就不再是好的度量——这正是 OpenAI 在优化那些难以或高成本测量的目标时必须面对的 Goodhart 定律难题。
OpenAI 发布题为 Text and code embeddings by contrastive pre-training 的文章,介绍通过对比预训练得到的文本与代码嵌入。原文抓取失败,仅标题可用,详情需查看 https://openai.com/index/text-and-code-embeddings-by-contrastive-pre-training。
OpenAI 训练了一个求解小学数学应用题的系统,准确率接近微调 GPT-3 模型的两倍。在同一批测试题上,9-12 岁儿童小样本得分为 60%,该系统得分为 55%,约达到真实儿童解题量的 90%。
OpenAI 发布通过人类反馈扩展 AI 系统人类监督的研究,针对难以评估的任务训练书籍摘要模型。原文仅提供一句话摘要,未给出更多实验细节。
Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 分布式协作训练方法,可自适应参与者的网络与硬件条件。该方法由 40 名志愿者协同预训练了孟加拉语模型 sahajBERT(约 18M 参数,基于 ALBERT),在 NER 上 F1 达 95.45、NCC 准确率 91.97,结果与数百块 V100 训练的 XLM-R-large 相当。
推荐理由:原文给出 DeDLOC 协作训练方法细节和 40 名志愿者预训练 sahajBERT 的实测结果,含下游任务对比数据,方法可复用。
OpenAI 发表论文《Evaluating large language models trained on code》,主题为评估基于代码训练的大语言模型。抓取仅获取到标题,正文内容不可用。
OpenAI 最新研究发现,通过在一个小规模精选数据集上进行微调,可以改善语言模型在特定行为价值观方面的表现。
Hugging Face 2021年2月阅读小组聚焦长序列 Transformer 的注意力效率问题,重点解读四篇论文:Longformer(定制注意力模式)、Compressive Transformer(循环机制)、Linformer(低秩近似)和 Performer(核近似)。
OpenAI 发现在 CLIP 中存在对同一概念产生响应的神经元,无论该概念以字面、符号或概念形式呈现。这一现象可能解释了 CLIP 在对概念的出人意料的视觉表现形式进行分类时的准确性,也是理解 CLIP 及类似模型所学习的关联与偏差的重要一步。
推荐理由:原文指出了 CLIP 中多模态神经元的存在及其对理解模型学习关联与偏差的意义。
OpenAI 应用人类反馈的强化学习(RLHF)训练出在摘要任务上表现更好的语言模型。
第三届 OpenAI Scholars 学员在线上 Demo Day 展示了结业项目,呈现过去五个月的研究成果。
OpenAI 发布 Image GPT,将与语言模型相同架构的 Transformer 训练在像素序列上,可生成连贯的图像补全和样本。研究建立了生成样本质量与图像分类精度之间的相关性,其最佳生成模型在无监督设置下提取的特征可与顶级卷积网络竞争。
OpenAI 参与了一份由 30 家机构、58 位作者共同撰写的多方报告,提出 10 项机制用于提升 AI 系统相关声明的可验证性。报告由未来智能研究中心、Mila 等机构参与完成。开发者可借助这些机制提供 AI 系统安全、公平或隐私保护的证据,用户、政策制定者和公民社会也可用来评估 AI 开发流程。
OpenAI 发表关于神经语言模型缩放定律的研究,原文正文抓取失败,仅标题可用。
OpenAI 发现双重下降(double descent)现象广泛存在于 CNN、ResNets 和 Transformers 中:随着模型规模、数据量或训练时间增加,性能先提升、再下降、随后再次提升。通过仔细的正则化通常可以避免这一效应。该现象目前尚无完整解释,OpenAI 认为对其进一步研究是重要方向。
OpenAI 发布 Procgen Benchmark,包含 16 个简单易用的程序化生成环境,可直接衡量强化学习智能体学习可泛化技能的速度。该基准可用于评估智能体的泛化能力。
OpenAI 用人类反馈微调了 774M 参数的 GPT-2 语言模型,在多种任务上成功匹配外部人工标注者的偏好。摘要任务用了 6 万条人工标注,简单的续写风格任务只需 5 千条;标注者的偏好并非总与团队一致,例如摘要标注者偏好整句照抄原文,模型随之学会了照抄。OpenAI 表示此举旨在让安全技术更接近“机器与人对话”这一通用任务。
推荐理由:原文给出了用人类偏好微调 GPT-2 的任务效果、标注成本与偏好偏差实例,可了解早期 RLHF 实践细节。
OpenAI 报告,智能体在其新构建的模拟捉迷藏环境中训练时逐步发现了更复杂的工具使用。智能体建立了六种不同的策略与反制策略,其中一些是团队此前不知道环境所支持的;这种自监督的涌现复杂性表明多智能体协同适应或能产生极为复杂和智能的行为。
推荐理由:原文报告了多智能体博弈中自发涌现工具使用的观察,对理解智能体协同演化行为的读者有背景价值。
OpenAI 开发了一种评估神经网络分类器能否可靠抵御训练时未见的对抗攻击的方法,并提出新指标 UAR(Unforeseen Attack Robustness)。该指标用于衡量单个模型面对未预期攻击的鲁棒性,并强调需要在更多样化的未知攻击上测量模型性能。
OpenAI 发布政策研究论文,提出四种可立即采用的策略以促进 AI 行业在安全规范上的长期合作:沟通风险与收益、技术协作、提高透明度和激励标准。分析指出,行业安全合作对确保 AI 系统安全有益至关重要,但竞争压力可能导致集体行动问题,使 AI 公司在安全上投入不足。