Hugging Face 与 Atla 推出 Judge Arena,众包评测 LLM 作为评判模型的能力
Hugging Face 与 Atla 推出 Judge Arena 平台,让用户对两个 LLM 评判模型在同一测试样本上的打分与理由进行投票,结果以 Elo 分数汇入每小时更新的公开排行榜。
Hugging Face 与 Atla 推出 Judge Arena 平台,让用户对两个 LLM 评判模型在同一测试样本上的打分与理由进行投票,结果以 Elo 分数汇入每小时更新的公开排行榜。
Intel Labs 与 Hugging Face 推出 Universal Assisted Generation(UAG),通过双向 tokenizer 翻译让辅助生成不再要求目标模型与助手模型共享同一 tokenizer,可将任意 decoder 或 MoE 模型的推理加速 1.5x-2.0x 且几乎零开销。
推荐理由:原文解释了跨 tokenizer 助手模型的实现原理并给出多组加速数据,还提供 Transformers 4.46.0 的可用代码。
Intel labs 与 Hugging Face 提出动态推测解码,通过基于草稿模型置信度阈值动态调整每轮推测 lookahead,文本生成最高加速 2.7x,并从 Transformers 4.45.0 起成为辅助生成的默认模式。
OpenAI 发布题为 Learning to reason with LLMs 的文章,主题是让大语言模型学习推理。本次抓取仅获取到标题,正文内容缺失,无法提供更多细节。原文链接:https://openai.com/index/learning-to-reason-with-llms
OpenAI 官宣 o1-mini,定位为更具成本效益的推理模型。原文正文缺失,仅提供标题与副标题“Advancing cost-efficient reasoning”,具体能力、定价和可用性细节以官方后续说明为准。
推荐理由:官方原文仅给出标题与口号,正文缺失,难以提炼具体阅读价值。
经济学家 Tyler Cowen 讲解 OpenAI o1 处理复杂经济学问题的方式,展示该模型在经济学推理任务上的表现。
遗传学家 Catherine Brownstein 展示了如何用 OpenAI o1 加速罕见疾病诊断过程。o1 在该场景下用于辅助解码基因信息,缩短罕见疑难病症的诊断耗时。
量子物理学家 Mario Krenn 使用 OpenAI o1 协助解答物理问题。原文内容较为简短,仅说明他将该模型用于探索重大科学问题的研究工作。
Cognition 联合创始人兼 CEO Scott Wu 解释了 OpenAI o1 如何以更像人类的方式做出编程决策。
Mistral AI 发布 Mistral Large 2(版本 24.07,API 名称 mistral-large-2407),参数量 123B,拥有 128k 上下文窗口,MMLU 预训练准确率 84.0%。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。
推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。
OpenAI 探讨了 prover-verifier games(证明者-验证者博弈)如何提升语言模型输出的可读性。该方法使 AI 给出的解决方案更清晰、更易验证,对人类和机器而言都更值得信赖。
Mistral AI 发布 Mathstral,一个基于 Mistral 7B、面向 STEM 复杂多步推理的指令模型,与 Project Numina 合作产出,权重托管在 HuggingFace。
Numina 与 Hugging Face 合作微调的 NuminaMath 7B TIR 赢得首届 AIMO Progress Prize,在私有测试集 50 题中解出 29 题。
推荐理由:原文由获奖团队完整给出两阶段微调、SC-TIR 推理和防过拟合验证的做法,方法可迁移到数学推理模型训练。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低缓存精度显著减少长上下文生成的内存占用,同时保持生成质量。
OpenAI 宣布推出新旗舰模型 GPT-4o(GPT-4 Omni),该模型可实时对音频、视觉和文本进行推理。
推荐理由:官方宣布新旗舰模型 GPT-4o,可实时跨音频、视觉和文本推理,是了解该模型定位的直接信源。
Hugging Face Leaderboards 团队与 Dottxt 合作研究发现,MMLU 评测对提示词格式高度敏感,各模型分数随 8 种格式波动约 10 个点,Qwen1.5-7B 在不同提示下准确率从 22.9% 到 51.2%,且模型排名也随格式变化。
Hugging Face 推出 Open CoT Leaderboard,追踪 LLM 生成有效链式推理的能力。榜单不评绝对准确率,而是计算有无 CoT 提示的准确率差值 Δ,以检验 CoT 对准确率的实际影响,并对训练数据污染更稳健。评测采用 LogiQA 和 LSAT 数据集(多数属于 AGIEval),任务以选择题形式呈现,目前已实现 Classic 和 Reflect 两种提示策略。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。
推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。
密歇根大学和罗格斯大学研究团队推出 NPHardEval 排行榜,通过基于计算复杂度类的 900 道算法题(覆盖 P、NP-complete、NP-hard 共 9 种算法、10 个难度级别)评估 LLM 推理能力。
Hugging Face 博客演示如何用 speculative decoding 将 Whisper 语音转录推理时间降低约 2 倍,同时从数学上保证输出与原模型完全一致。
推荐理由:原文给出了完整的 speculative decoding 原理和实测代码,读者可以直接把它作为 Whisper 推理加速的替换方案。
Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。
推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。
Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。
推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。
Hugging Face 发布 Optimum-NVIDIA 推理库,改动一行代码即可在 NVIDIA 平台上获得最高 28 倍吞吐提升和 1200 tokens/second,首 token 延迟最高快 3.3 倍。
Mistral AI 发布 7.3B 参数开源模型 Mistral 7B,采用 Apache 2.0 许可证,在所有基准上超越 Llama 2 13B,并在多数基准上优于 Llama 1 34B。
推荐理由:官方给出与 Llama 2 全面对比的评测数据和架构改进细节,读者可据此评估 7B 级开源模型的性价比与部署选择。
TII 发布 Falcon 180B,为当时最大的开放语言模型,拥有 1800 亿参数,使用 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练。
推荐理由:原文给出了参数量、训练规模、评测对比和完整部署硬件门槛,读者可以据此评估是否在自己的场景中采用这个开源模型。
OpenAI 训练模型在数学问题求解上取得新的 SOTA,方法是对每一步正确推理给予奖励(process supervision),而非只奖励最终正确答案(outcome supervision)。除性能优于结果监督外,过程监督还有对齐上的好处,直接训练模型产出人类认可的思维链。
推荐理由:原文说明了过程监督相对结果监督的性能与对齐优势,帮助读者理解链式推理训练的一个方向。
Hugging Face 在 Transformers 中推出 Assisted Generation 解码方法,用小模型生成候选 token、大模型前向传播验证,降低自回归文本生成延迟。
推荐理由:原文解释了文本生成延迟来自内存带宽而非计算,并给出 Assisted Generation 的原理、代码和延迟数据,方法可直接复现。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练教程,演示如何将 LLaMA 7B 微调用于回答 Stack Exchange 问答。
推荐理由:Hugging Face 官方复盘 StackLLaMA 全流程训练细节,包括显存估算、LoRA 配置和 RLHF 训练中的稳定性坑,方法可直接迁移复用。
OpenAI 发布 GPT-4,称其为扩大深度学习规模的最新里程碑。GPT-4 是一个大型多模态模型,接受图像和文本输入、输出文本;虽然许多真实场景下仍不及人类,但在多项专业和学术基准上表现出人类水平性能。
推荐理由:官方原文明确 GPT-4 接受图像和文本输入,并在多项专业与学术基准上达到人类水平表现,可据此了解其能力定位。
Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。
推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。
Hugging Face 发布图机器学习入门教程,讲解图的基本概念、表示方法及应用任务,涵盖图级、节点级、边级和子图级任务,如 AlphaFold 的节点属性预测和推荐系统中的缺失边预测。文章依次介绍从前神经网络方法到图神经网络(GNN)的学习方式,并简要探讨面向图的 Transformer,聚焦同质图,区分 transductive 与 inductive 两种设置。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个无需提示词的少样本文本分类框架。每类仅需 8 个标注样本即可在 Customer Reviews 数据集上媲美用全量 3k 样本微调的 RoBERTa Large;在 RAFT 基准上 355M 参数的 SetFit 超过 PET 和 GPT-3。
推荐理由:官方详解 SetFit 的原理、训练成本和 RAFT 实测数据,并附可复现的训练代码,方便直接上手做少样本分类。
Hugging Face 推出免费的深度强化学习课程(Deep Reinforcement Learning Class),第一章讲解 RL 基础理论,包括 RL 流程、reward hypothesis、Markov 性质、策略与价值方法等核心概念。
Hugging Face 宣布将离线强化学习方法 Decision Transformer 集成进 🤗 transformers 库和 Hugging Face Hub。
OpenAI 构建了一个面向 Lean 的神经定理证明器,能解多种有挑战性的高中奥赛题,包括 AMC12 和 AIME 竞赛题,以及两道由 IMO 改编的题目。
OpenAI 训练了一个求解小学数学应用题的系统,准确率接近微调 GPT-3 模型的两倍。在同一批测试题上,9-12 岁儿童小样本得分为 60%,该系统得分为 55%,约达到真实儿童解题量的 90%。
Hugging Face 讲解如何用 EleutherAI 的 GPT-Neo 和 🤗 Accelerated Inference API 实现 Few-Shot Learning 预测。
Hugging Face 2021年2月阅读小组聚焦长序列 Transformer 的注意力效率问题,重点解读四篇论文:Longformer(定制注意力模式)、Compressive Transformer(循环机制)、Linformer(低秩近似)和 Performer(核近似)。