跳到正文

#推理

今日 1 条
8月7日周四
  1. OpenAI News41

    GPT-5 与工作新纪元

    OpenAI 发文称 GPT-5 是其最先进的模型,将变革企业级 AI、自动化与劳动力生产力。文章把 GPT-5 定位为智能工作新纪元的核心驱动力,聚焦企业场景下的自动化与工作效率提升。

  2. OpenAI News82

    OpenAI 发布 GPT-5 系统卡,介绍统一模型路由机制

    OpenAI 发布 GPT-5 系统卡,说明统一模型路由系统如何在 gpt-5-main、gpt-5-thinking 和轻量版 gpt-5-thinking-nano 之间分配请求,以兼顾快速和智能的响应。各变体针对不同任务和开发者使用场景做了优化。

    推荐理由:官方系统卡说明 GPT-5 的统一路由机制,读者可以据此理解不同 gpt-5 变体如何按任务分配响应。

8月5日周二
  1. Hugging Face Blog92

    OpenAI 开源 GPT OSS 模型家族:gpt-oss-120b 与 gpt-oss-20b

    OpenAI 发布开源权重模型 GPT OSS,包含 117B 参数的 gpt-oss-120b 和 21B 参数的 gpt-oss-20b,均采用 MoE 架构和 MXFP4 4-bit 量化,分别可装入单张 H100 和 16GB 显存,采用 Apache 2.0 许可证。

    推荐理由:文章给出两个模型的参数量、量化方案和各硬件平台的具体推理优化建议,读者可按自己的 GPU 直接选择部署路径。

  2. OpenAI News85

    OpenAI 发布开放权重模型 gpt-oss-120b 和 gpt-oss-20b

    OpenAI 发布 gpt-oss-120b 和 gpt-oss-20b 两款开放权重语言模型,采用 Apache 2.0 许可证。官方称二者在推理任务上优于同等规模的开源模型,具备较强的工具调用能力,并针对消费级硬件上的高效部署做了优化。

    推荐理由:OpenAI 官方发布两款开放权重模型,读者可以据此了解其推理表现、工具调用能力和在消费级硬件上的部署定位。

8月1日周五
7月29日周二
7月17日周四
6月10日周二
6月4日周三
  1. Hugging Face Blog57

    Hugging Face 在 nanoVLM 中从零实现 KV Caching

    Hugging Face 在 nanoVLM 仓库中从零实现 KV Caching,生成速度提升 38%。文章讲解自回归生成中重复计算 K/V 的冗余来源,展示通过逐层缓存字典、start_pos 位置对齐以及将 generate 循环拆分为 prefill 和 decode 两阶段来消除冗余计算,并指出这是速度与显存之间的权衡。

5月21日周三
4月30日周三
4月26日周六
4月16日周三
  1. OpenAI News83

    OpenAI 发布 o3 与 o4-mini 模型

    OpenAI 发布 o3 和 o4-mini 两款新模型,称其为迄今最智能、能力最强的模型,并支持完整的工具调用。

    推荐理由:官方宣布 o3 与 o4-mini 两款新模型,主打更强能力与完整工具调用,想了解 OpenAI 推理模型最新进展可由此入手。

  2. OpenAI News77

    OpenAI 发布 o3 与 o4-mini 系统卡

    OpenAI 发布 o3 与 o4-mini 系统卡,两款模型结合了先进推理能力与完整工具能力。工具能力涵盖网页浏览、Python、图像与文件分析、图像生成、canvas、automations、文件搜索和 memory。

    推荐理由:官方说明 o3 与 o4-mini 同时具备推理和完整工具调用能力,读者可据此了解这两个新模型的能力范围。

4月14日周一
4月8日周二
3月27日周四
  1. Hugging Face Blog74

    DeepSeek-V3-0324 上架 Hugging Face Hub,Hugging Face 团队详解性能与使用方式

    DeepSeek-V3 更新版 0324 上架 Hugging Face Hub,架构与原版相同并改为 MIT 许可,重点改进指令遵循、代码与数学能力。官方基准显示 MMLU-Pro 75.9→81.2、AIME 39.6→59.4、LiveCodeBench 39.2→49.2,常与 GPT-4.5 相当、普遍强于 Claude-Sonnet-3.7。

    推荐理由:原文汇总了基准对比、能力改进细节和多种本地部署路径,读者可据此评估是否在自己的工作流中替换旧版 V3。

3月12日周三
  1. Hugging Face Blog63

    Hugging Face Open R1 更新:发布 CodeForces-CoTs 数据集、IOI 基准与 OlympicCoder 7B/32B 模型

    Hugging Face 在 Open R1 第三次更新中发布了从 DeepSeek-R1 蒸馏的 CodeForces-CoTs 数据集(近 10 万样本)、2024 年 IOI 题目构成的 IOI 基准,以及基于 Qwen2.5 Coder 微调的 OlympicCoder-7B 和 OlympicCoder-32B。

    推荐理由:Hugging Face 官方复盘训练过程,给出样本打包、学习率等可复用经验,并附带完整数据集、基准和评测代码。

3月10日周一
  1. OpenAI News64

    OpenAI:用 LLM 监控思维链可检测前沿推理模型的不当行为

    OpenAI 发现前沿推理模型有机会时会利用漏洞,但可以用另一个 LLM 监控其思维链来检测这类利用行为。研究还发现,惩罚模型的坏想法并不能阻止大多数不当行为,反而会让模型隐藏其意图。

    推荐理由:原文给出思维链监控可检测推理模型钻漏洞,而惩罚坏想法反而促使模型隐藏意图这一关键反直觉发现。

2月27日周四
2月11日周二
  1. Hugging Face Blog62

    Hugging Face Open R1 更新:发布 OpenR1-Math-220k 数学推理数据集

    Hugging Face Open R1 项目发布首个大规模数学推理数据集 OpenR1-Math-220k,在 512 张 H100 上用 DeepSeek R1 为 40 万道题生成 80 万条推理轨迹,经 Math Verify 和 Llama3.3-70B-Instruct 过滤后保留 22 万条正确轨迹。

    推荐理由:原文详述数学推理数据集的构建方法、过滤策略与消融结果,也覆盖社区在小样本微调和 CoT 长度控制上的进展。

2月4日周二
2月3日周一
  1. OpenAI News77

    OpenAI 推出 deep research 智能体

    OpenAI 推出 deep research,一个用推理能力整合大量网络信息、完成多步研究任务的智能体。即日起面向 Pro 用户开放,Plus 和 Team 用户随后可用。

    推荐理由:官方说明了 deep research 的能力定位和开放节奏,读者可以据此了解它面向的用户范围。

2月2日周日
1月31日周五
1月28日周二
  1. Hugging Face Blog57

    Hugging Face 启动 Open-R1 项目,系统复现 DeepSeek-R1 训练流程

    Hugging Face 发布博客宣布启动 Open-R1 项目,目标是在开放环境下重建 DeepSeek-R1 的数据与训练流程。博客解释了 DeepSeek-R1 基于DeepSeek-V3 的两阶段训练方法,包括 R1-Zero 用 GRPO 纯强化学习训练和 R1 的冷启动微调加多轮 RL 提炼,并指出 DeepSeek 未公开训练数据、训练代码和超参数细节。

12月20日周五
  1. OpenAI News60

    OpenAI 发布 Deliberative alignment 研究,让 o1 模型通过推理执行安全规范

    OpenAI 推出面向 o1 模型的新对齐策略 Deliberative alignment,直接教模型安全规范并让其对这些规范进行推理。该方法旨在通过推理能力提升语言模型的安全性。

    推荐理由:OpenAI 官方介绍了 o1 系列采用的对齐策略思路,可作为理解推理能力如何用于安全规范的参考材料。

12月18日周三
12月17日周二
12月5日周四
11月25日周一
  1. Hugging Face Blog60

    Hugging Face 博客逐步推导 Transformer 位置编码如何演进到 RoPE

    Hugging Face 博客以迭代推导方式讲解位置编码设计,从整数编码、二进制编码到正弦编码,最终推导出 Llama 3.2 等现代 Transformer 采用的 RoPE。

    推荐理由:文章把 RoPE 的设计过程拆成可跟随的迭代推导,从整数编码一步步走到旋转矩阵,适合想理解位置编码原理的读者。

11月20日周三
  1. Hugging Face Blog42

    让大模型辩论:首届多语言 LLM 辩论竞赛

    BAAI 推出 FlagEval Debate「Debate Arena」平台,让大模型两两辩论比拼推理与语言能力,目前支持中文、英文、阿拉伯语和韩语四语种。平台采用专家评审加用户投票的双评估体系,并允许参赛团队微调模型参数与对话策略。相比 LMSYS Chatbot Arena 等静态或用户投票式评测,它能缓解区分度不足、模型各自独立生成和投票偏好偏差等问题。