NPHardEval 排行榜上线:用复杂度类与动态更新测大语言模型推理能力
密歇根大学和罗格斯大学研究团队推出 NPHardEval 排行榜,通过基于计算复杂度类的 900 道算法题(覆盖 P、NP-complete、NP-hard 共 9 种算法、10 个难度级别)评估 LLM 推理能力。
密歇根大学和罗格斯大学研究团队推出 NPHardEval 排行榜,通过基于计算复杂度类的 900 道算法题(覆盖 P、NP-complete、NP-hard 共 9 种算法、10 个难度级别)评估 LLM 推理能力。
Hugging Face 博客演示如何用 speculative decoding 将 Whisper 语音转录推理时间降低约 2 倍,同时从数学上保证输出与原模型完全一致。
推荐理由:原文给出了完整的 speculative decoding 原理和实测代码,读者可以直接把它作为 Whisper 推理加速的替换方案。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。
推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。
Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。
推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。
Hugging Face 发布 Optimum-NVIDIA 推理库,改动一行代码即可在 NVIDIA 平台上获得最高 28 倍吞吐提升和 1200 tokens/second,首 token 延迟最高快 3.3 倍。
Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。
推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。
TII 发布 Falcon 180B,为当时最大的开放语言模型,拥有 1800 亿参数,使用 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练。
推荐理由:原文给出了参数量、训练规模、评测对比和完整部署硬件门槛,读者可以据此评估是否在自己的场景中采用这个开源模型。
OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。
推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。
Hugging Face 在 Transformers 中推出 Assisted Generation 解码方法,用小模型生成候选 token、大模型前向传播验证,降低自回归文本生成延迟。
推荐理由:原文解释了文本生成延迟来自内存带宽而非计算,并给出 Assisted Generation 的原理、代码和延迟数据,方法可直接复现。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练教程,演示如何将 LLaMA 7B 微调用于回答 Stack Exchange 问答。
推荐理由:Hugging Face 官方复盘 StackLLaMA 全流程训练细节,包括显存估算、LoRA 配置和 RLHF 训练中的稳定性坑,方法可直接迁移复用。
OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。
推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。
Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。
推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。
Hugging Face 发布图机器学习入门教程,讲解图的基本概念、表示方法及应用任务,涵盖图级、节点级、边级和子图级任务,如 AlphaFold 的节点属性预测和推荐系统中的缺失边预测。文章依次介绍从前神经网络方法到图神经网络(GNN)的学习方式,并简要探讨面向图的 Transformer,聚焦同质图,区分 transductive 与 inductive 两种设置。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个无需提示词的少样本文本分类框架。每类仅需 8 个标注样本即可在 Customer Reviews 数据集上媲美用全量 3k 样本微调的 RoBERTa Large;在 RAFT 基准上 355M 参数的 SetFit 超过 PET 和 GPT-3。
推荐理由:官方详解 SetFit 的原理、训练成本和 RAFT 实测数据,并附可复现的训练代码,方便直接上手做少样本分类。
Hugging Face 推出免费的深度强化学习课程(Deep Reinforcement Learning Class),第一章讲解 RL 基础理论,包括 RL 流程、reward hypothesis、Markov 性质、策略与价值方法等核心概念。
Hugging Face 宣布将离线强化学习方法 Decision Transformer 集成进 🤗 transformers 库和 Hugging Face Hub。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能解多种有挑战性的高中奥赛题,包括 AMC12 和 AIME 竞赛题,以及两道由 IMO 改编的题目。
OpenAI 训练了一个求解小学数学应用题的系统,准确率接近微调 GPT-3 模型的两倍。在同一批测试题上,9-12 岁儿童小样本得分为 60%,该系统得分为 55%,约达到真实儿童解题量的 90%。
Hugging Face 讲解如何用 EleutherAI 的 GPT-Neo 和 🤗 Accelerated Inference API 实现 Few-Shot Learning 预测。
Hugging Face 2021年2月阅读小组聚焦长序列 Transformer 的注意力效率问题,重点解读四篇论文:Longformer(定制注意力模式)、Compressive Transformer(循环机制)、Linformer(低秩近似)和 Performer(核近似)。
Hugging Face 发布长文教程,详解基于 Transformer 的编码器-解码器架构如何建模序列到序列任务。文章从 RNN 编码器-解码器模型的历史讲起,分解编码器的双向自注意力与解码器的单向自注意力和交叉注意力机制,并以 MarianMT 模型代码演示 .generate() 自回归推理,涵盖 T5、Bart、Pegasus 等模型背景,但不涉及训练方法。
Hugging Face 深入解析 Kitaev、Kaiser 等人在 2020 年提出的 Reformer 模型:通过 Reformer Self-Attention。
Hugging Face 博客讲解自回归语言生成的主要解码策略,包括 Greedy search、Beam search、Sampling、Top-K 和 Top-p(nucleus)sampling,并用 GPT2 给出 transformers 库中可直接运行的代码示例。
OpenAI 训练了一对神经网络,用仿人机器手还原魔方,训练完全在仿真中进行,采用与 OpenAI Five 相同的强化学习代码和新技术 Automatic Domain Randomization(ADR)。系统能应对训练中未见过的情况,例如被长颈鹿玩偶戳动,表明强化学习可解决需要极高灵巧度的现实物理问题。
推荐理由:原文说明神经网络完全在仿真中训练即可操控机械手还原魔方,并给出 ADR 这一可迁移到其他物理任务的方法。
OpenAI 训练了一个大规模无监督语言模型,能生成连贯段落文本,在多项语言建模基准上达到当时最优表现。该模型无需任务特定训练即可完成基础阅读理解、机器翻译、问答和摘要任务。
推荐理由:OpenAI 自述该无监督语言模型在多项基准上达到 SOTA 并零样本完成多任务,可作为了解无任务特定训练能力的背景材料。
OpenAI 开发出一种能量模型,只需五个演示即可快速学会识别和生成 near、above、between、closest、furthest 等以二维点集表达的概念。该模型还展现出跨域迁移能力:在二维粒子环境中学到的概念可被用于求解三维物理仿真机器人上的任务。
OpenAI 提出 Random Network Distillation(RND),一种通过好奇心鼓励强化学习智能体探索环境的基于预测的奖励方法。该方法在 Montezuma's Revenge 上首次超过人类平均水平。
OpenAI 提出一项名为 iterated amplification 的 AI 安全技术,通过演示如何把任务分解为更简单的子任务,来指定超越人类规模的复杂行为和目标,而无需提供标注数据或奖励函数。目前该想法仍处早期阶段,实验仅在简单的玩具算法领域完成,但 OpenAI 认为其可能成为可扩展的 AI 安全方法。
OpenAI 训练的智能体仅凭一条人类演示,在 Montezuma's Revenge 上取得 74,500 的高分,超过此前已发表结果。方法是从演示中精心挑选的起始状态开始游玩,并用 PPO 优化游戏得分,与 OpenAI Five 所用的强化学习算法相同。
OpenAI 宣布其由五个神经网络组成的系统 OpenAI Five,已开始在 Dota 2 中击败业余人类队伍。
OpenAI 宣布以可扩展、任务无关的系统在多项多样化语言任务上取得 SOTA 结果,并开放发布该系统。方法结合 Transformer 与无监督预训练两个已有思路,团队认为结果证明了监督学习搭配无监督预训练的有效性,希望推动在更大更多样数据集上的进一步研究。
推荐理由:原文给出无监督预训练加 Transformer 的方法组合和多任务 SOTA 结果,可帮读者理解预训练思路的实际成效。
OpenAI 宣布其 Dota 2 bot 在标准赛事规则的 1v1 对局中击败世界顶尖职业选手。该 bot 从零开始通过自对弈学习,不使用模仿学习或树搜索。作者称这是向在涉及真实人类的混乱复杂环境中完成明确目标的 AI 系统迈出的一步。
推荐理由:原文点明该 bot 完全靠自对弈从零学习、不用模仿学习和树搜索,可帮助读者理解其在复杂环境 AI 中的定位。