跳到正文

#Agent

今日 11 条
12月10日周三
12月9日周二
  1. Mistral AI69

    Mistral 发布 Devstral 2(123B)与 Devstral Small 2(24B)编码模型及 Mistral Vibe CLI

    Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。

    推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。

12月4日周四
  1. Hugging Face Blog44

    DeepMath:基于 smolagents 的轻量级数学推理智能体

    Intel AI 软件团队推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并通过 smolagents 实现的数学推理智能体。模型用简短 Python 代码片段替代冗长文本推理,在沙箱中执行后回填推理上下文,输出长度最多减少 66%,同时常提升准确率。在 MATH500、AIME、HMMT、HLE 四个数据集上,GRPO 训练与智能体推理结合取得最高准确率。

  2. Hugging Face Blog74

    Hugging Face 发布 Skills 让 Claude 等编码智能体完成开源模型微调

    Hugging Face 推出 hf-llm-trainer 技能,让 Claude Code、Codex、Gemini CLI 等编码智能体可自动选择 GPU、生成脚本、向 Hugging Face Jobs 提交微调任务并用 Trackio 监控进度,完成后模型自动推送到 Hub。

    推荐理由:官方发布了让 Claude Code 等编码智能体端到端微调开源模型的 hf-llm-trainer 技能,覆盖 GPU 选择、任务提交到监控的完整流程。

12月2日周二
12月1日周一
11月25日周二
11月24日周一
11月19日周三
  1. OpenAI News67

    OpenAI 发布 GPT-5.1-Codex-Max 编码模型

    OpenAI 推出面向 Codex 的 GPT-5.1-Codex-Max,定位为更快速、更智能的智能体编码模型。该模型面向长时间运行的项目级工作,具备增强的推理能力和更高的 token 效率。

    推荐理由:官方说明了该模型面向长时间项目级任务定位,并强调推理与 token 效率改进,可作为选用参考。

11月13日周四
11月7日周五
10月30日周四
10月28日周二
10月27日周一
10月24日周五
10月23日周四
10月8日周三
10月7日周二
  1. Hugging Face Blog68

    BigCode 发布 BigCodeArena:通过代码执行端到端评判代码生成模型

    BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。

    推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。

10月6日周一
9月29日周一
9月25日周四
9月23日周二
9月22日周一
  1. Hugging Face Blog61

    Meta 发布 Gaia2 智能体基准及开源评估框架 ARE

    Meta 的 Hugging Face 团队发布 GAIA 后续基准 Gaia2 和配套开源框架 Meta Agents Research Environments(ARE),Gaia2 数据集采用 CC BY 4.0 许可,ARE 采用 MIT 许可。

    推荐理由:官方发布新基准 Gaia2 和开源评估框架 ARE,含七类任务和主流模型结果,便于开发者调试和评估自己的 Agent。

9月15日周一
  1. OpenAI News61

    OpenAI 发布 GPT-5-Codex:针对 Codex 智能体编码优化

    OpenAI 在 GPT-5 系统卡附录中发布新模型 GPT-5-Codex,是针对 Codex 中智能体编码进一步优化的 GPT-5 版本。该模型会根据任务复杂度更动态地调整思考力度,简单对话或小任务快速响应,复杂任务则可独立长时间工作。

    推荐理由:原文说明新模型在思考力度上按任务复杂度动态调整,读者可了解其与 GPT-5 在编码场景下的差异。

9月10日周三
  1. Hugging Face Blog64

    Hugging Face 发布 Jupyter Agent:微调 Qwen3-4B 提升 DABStep 数据科学任务表现

    Hugging Face 发布 Jupyter Agent 项目,用约 2TB Kaggle 笔记本构建 51k 条合成轨迹、近 0.2B tokens 的数据集,微调 Qwen3-4B-Instruct-2507 与 Qwen3-4B-Thinking-2507。

    推荐理由:原文完整给出从数据清洗到微调的管线与消融数字,读者可复用其中提升小模型数据科学能力的做法。

9月2日周二
  1. Mistral AI53

    Mistral 为 Le Chat 推出 Memories(beta)记忆功能

    Mistral 为 Le Chat 推出 Memories(beta)记忆功能,采用自动保存与智能、可见召回的混合方案。功能遵循透明、可控、主权三原则,用户可随时关闭记忆、开启隐身聊天、编辑或删除单条记忆,并支持导出导入;还提供 Memory Insights 轻量提示帮助探索记忆内容,移动端可在 App Store 或 Google Play 下载体验。