跳到正文

推理能力

模型推理能力的进展:思维链、推理模型、数学与逻辑基准的突破与争议。

最新精选

第 61–80 条 · 共 93 条
3月10日周一
  1. OpenAI News64

    OpenAI:用 LLM 监控思维链可检测前沿推理模型的不当行为

    OpenAI 发现前沿推理模型有机会时会利用漏洞,但可以用另一个 LLM 监控其思维链来检测这类利用行为。研究还发现,惩罚模型的坏想法并不能阻止大多数不当行为,反而会让模型隐藏其意图。

    推荐理由:原文给出思维链监控可检测推理模型钻漏洞,而惩罚坏想法反而促使模型隐藏意图这一关键反直觉发现。

2月11日周二
  1. Hugging Face Blog62

    Hugging Face Open R1 更新:发布 OpenR1-Math-220k 数学推理数据集

    Hugging Face Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 DeepSeek R1 为 40 万道题生成 80 万条推理轨迹,经 Math Verify 和 Llama3.3-70B-Instruct 过滤后保留 22 万条正确轨迹。

    推荐理由:原文详述数学推理数据集的构建方法、过滤策略与消融结果,也覆盖社区在小样本微调和 CoT 长度控制上的进展。

2月3日周一
  1. OpenAI News77

    OpenAI 推出 deep research 智能体

    OpenAI 推出 deep research,一个用推理能力整合大量网络信息、完成多步研究任务的智能体。即日起面向 Pro 用户开放,Plus 和 Team 用户随后可用。

    推荐理由:官方说明了 deep research 的能力定位和开放节奏,读者可以据此了解它面向的用户范围。

2月2日周日
1月31日周五
12月20日周五
  1. OpenAI News60

    OpenAI 发布 Deliberative alignment 研究,让 o1 模型通过推理执行安全规范

    OpenAI 推出面向 o1 模型的新对齐策略 Deliberative alignment,直接教模型安全规范并让其对这些规范进行推理。该方法旨在通过推理能力提升语言模型的安全性。

    推荐理由:OpenAI 官方介绍了 o1 系列采用的对齐策略思路,可作为理解推理能力如何用于安全规范的参考材料。

12月17日周二
12月5日周四
12月3日周二
11月25日周一
  1. Hugging Face Blog60

    Hugging Face 博客逐步推导 Transformer 位置编码如何演进到 RoPE

    Hugging Face 博客以迭代推导方式讲解位置编码设计,从整数编码、二进制编码到正弦编码,最终推导出 Llama 3.2 等现代 Transformer 采用的 RoPE。

    推荐理由:文章把 RoPE 的设计过程拆成可跟随的迭代推导,从整数编码一步步走到旋转矩阵,适合想理解位置编码原理的读者。

10月29日周二
  1. Hugging Face Blog65

    Intel Labs 与 Hugging Face 推出 Universal Assisted Generation,跨模型家族加速解码 1.5x-2.0x

    Intel Labs 与 Hugging Face 推出 Universal Assisted Generation(UAG),通过双向 tokenizer 翻译让辅助生成不再要求目标模型与助手模型共享同一 tokenizer,可将任意 decoder 或 MoE 模型的推理加速 1.5x-2.0x 且几乎零开销。

    推荐理由:原文解释了跨 tokenizer 助手模型的实现原理并给出多组加速数据,还提供 Transformers 4.46.0 的可用代码。

9月12日周四
  1. OpenAI News64

    OpenAI 发布 o1-mini,主打高性价比推理

    OpenAI 官宣 o1-mini,定位为更具成本效益的推理模型。原文正文缺失,仅提供标题与副标题“Advancing cost-efficient reasoning”,具体能力、定价和可用性细节以官方后续说明为准。

    推荐理由:官方原文仅给出标题与口号,正文缺失,难以提炼具体阅读价值。

7月18日周四
  1. Mistral AI70

    Mistral 与 NVIDIA 联合发布 12B 开源模型 Mistral NeMo

    Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。

    推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。

7月11日周四
5月13日周一
  1. OpenAI News81

    OpenAI 发布新旗舰模型 GPT-4o

    OpenAI 宣布推出新旗舰模型 GPT-4o(GPT-4 Omni),该模型可实时对音频、视觉和文本进行推理。

    推荐理由:官方宣布新旗舰模型 GPT-4o,可实时跨音频、视觉和文本推理,是了解该模型定位的直接信源。

4月17日周三
  1. Mistral AI72

    Mistral AI 开源发布 Mixtral 8x22B 稀疏 MoE 模型

    Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。

    推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。

2月26日周一
  1. Mistral AI75

    Mistral 发布旗舰模型 Mistral Large 与低延迟 Mistral Small

    Mistral 发布旗舰语言模型 Mistral Large,称其在常用基准上仅次于 GPT-4,可通过 la Plateforme 和 Azure 使用,支持 32K tokens 上下文、英法德西意多语言、function calling 和 JSON 输出。同时发布优化延迟与成本的 Mistral Small,性能超过 Mixtral 8x7B,并简化了端点产品线、新增多币种定价。

    推荐理由:官方给出了 Mistral Large 的基准对比、多语言与 function calling 能力,读者可据此评估它在 API 可用模型中的位置。

12月20日周三
12月11日周一
  1. Mistral AI83

    Mistral AI 发布开放权重的稀疏混合专家模型 Mixtral 8x7B

    Mistral AI 发布 Mixtral 8x7B,一个采用 Apache 2.0 许可的开放权重稀疏混合专家模型(SMoE),在多数基准上超过 Llama 2 70B 且推理快 6 倍,多数标准基准上匹配或超越 GPT3.5。

    推荐理由:官方给出稀疏专家架构的参数激活比例、基准对比与部署方案,为开源模型选型提供了具体的成本性能参考。