Consilium:让多个 LLM 围桌协作达成共识
开发者在 Gradio Agents & MCP Hackathon 期间构建了多 LLM 协作平台 Consilium,让多个模型通过结构化辩论达成共识,并支持多数投票、排序选择等决策模式。
开发者在 Gradio Agents & MCP Hackathon 期间构建了多 LLM 协作平台 Consilium,让多个模型通过结构化辩论达成共识,并支持多数投票、排序选择等决策模式。
Hugging Face 提出 FutureBench,通过真实世界事件评测 AI 智能体预测未来的能力。该基准从新闻和 Polymarket 预测市场采集题目:基于 smolagents 的智能体用 DeepSeek-V3 生成预测问题,每次抓取约生成 5 道题、时间范围为一周,另有每周约 8 道来自 Polymarket 的问题。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两款新模型的 SWE-Bench Verified 分数、许可证与定价,可据此比较成本与代码智能体能力。
Hugging Face 发布 Python 库 ScreenEnv,可在 Docker 容器中创建隔离的 Ubuntu 桌面环境,用于测试和部署 GUI 智能体(Computer Use agents)。
推荐理由:原文给出在 Docker 中运行隔离 Ubuntu 桌面环境的用法和 API 与 MCP 两种接入方式,读者可直接复用搭建 GUI 智能体。
Genspark 基于 GPT-4.1 和 OpenAI Realtime API 构建了无代码个人智能体产品,在 45 天内实现 3600 万美元 ARR。
AI GTM 平台 Unify 使用 OpenAI 的 o3、GPT-4.1 和 CUA 自动化客户拓潜、调研与外联。借助超个性化消息和全天候工作流,Unify 帮助销售团队规模化生成销售管道,同时专注于高价值的客户互动。
Hugging Face 发布 ScreenSuite,一套覆盖感知、定位、单步操作和多步智能体四类能力的 GUI Agent 评测套件,整合 13 个基准,如 ScreenQA-Short、ScreenSpot-Pro、AndroidWorld 和 OSWorld。
H Company 发布开源 Action VLM 系列 Holo1(含 Holo1-3B 与 Holo1-7B),并同步开源含 1,639 项 UI 任务的 WebClick 多模态定位基准。
推荐理由:官方给出模型规格、定位准确率和每任务成本数字,读者可据此评估这套开源 GUI 自动化方案的实际性价比。
Hugging Face 发布研究,让 CodeAgent 以强制 JSON 结构同时生成 thoughts 和 code,在 GAIA、MATH、SimpleQA、Frames 等基准上比常规 CodeAgent 平均高出 2-7 个百分点。
推荐理由:原文给出结构化输出结合 CodeAgent 的实测数据与适用边界,读者可据此判断自己的模型规模是否适合启用该方案。
Mistral 发布新的 Agents API,将语言模型与代码执行、网页搜索、图像生成、文档库和 MCP 工具等内置连接器结合,用于构建企业级智能体应用。
推荐理由:官方完整说明新 API 的内置连接器、有状态对话与多智能体编排,附 SimpleQA 对比数字和多个 cookbook,可直接评估落地方式。
Hugging Face 发布 Python 版 Tiny Agents,将 huggingface_hub SDK 扩展为 MCP Client,用约 70 行代码即可构建可调用 MCP 工具的 Agent。
推荐理由:官方博客展示了 MCP Client 如何让约 70 行 Python 代码搭起可调用工具的 Agent,核心思路可迁移到自己的项目。
OpenAI 发布系统卡附录,宣布将 Operator 原本基于 GPT-4o 的模型替换为基于 OpenAI o3 的版本。API 版本仍保持基于 4o 不变。
Mistral AI 与 All Hands AI 联合发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 6 个百分点以上,并超越 GPT-4.1-mini 超过 20%。
推荐理由:原文给出 SWE-Bench Verified 具体分数和部署门槛,可判断这款开源编码模型在本地与隐私场景的可行性。
OpenAI 在 o3 和 o4-mini 系统卡附录中介绍云端编码智能体 Codex,底层为针对软件工程优化的 o3 版本 codex-1。该模型通过强化学习在多种环境的真实编码任务上训练,生成贴近人类风格和 PR 偏好的代码,精确遵循指令,并迭代运行测试直至通过。
推荐理由:原文说明了 codex-1 的训练方式与目标能力,读者可以了解 Codex 与一般代码补全的区别。
Mistral 发布 Le Chat Enterprise,由新模型 Mistral Medium 3 驱动,针对工具碎片化、知识集成不安全、模型僵化和 ROI 慢等企业痛点提供统一平台。
Hugging Face 博客对比 Qwen-3 与 Qwen-2.5、QwQ 的 Jinja chat template,总结出四点设计差异:Qwen-3 通过 enable_thinking 标志配合空 <think></think> 让推理变为可选项,而 QwQ 强制每次推理。
Hugging Face 官方博客介绍如何用 Gradio 将 Python 函数构建为 MCP 服务器,只需安装 gradio[mcp] 并在 .launch() 中设置 mcp_server=True,即可让 LLM 通过 Claude Desktop、Cursor、Cline 等 MCP Client 调用该应用作为工具。
推荐理由:官方教程演示只需在 launch 中设 mcp_server=True 即可把任意 Gradio 应用变成 MCP server,含资源和鉴权等进阶用法。
Hugging Face 发布 Tiny Agents 教程,展示在 InferenceClient 之上实现 MCP 客户端后,Agent 本质上只是一个 while 循环,全部代码约 50 行 TypeScript。
推荐理由:作者把 MCP 客户端到 Agent 的实现压缩成约 50 行 TypeScript,并提供可运行的开源代码,适合想理解 Agent 与 MCP 基本结构的开发者直接上手。
Cohere 正式成为 Hugging Face Hub 支持的 Inference Provider,也是首个在 Hub 上直接分享并提供模型推理的模型创建方。
OpenAI 发布了 BrowseComp,一个用于评估浏览智能体(browsing agents)的基准测试。该基准旨在衡量智能体执行网页浏览任务的能力。
OpenAI 推出 PaperBench,这是一个评估 AI 智能体复现前沿 AI 研究能力的 benchmark。
OpenAI 提出从基于意图的机器人转向主动式 AI 智能体的方向。这类智能体不再被动等待用户指令,而是能够主动采取行动。
Hebbia 推出基于 OpenAI 的深度研究智能体,可自动化金融和法律工作中 90% 的任务。该产品利用 AI 智能体处理相关工作流程,大幅减少人工操作。
Booking.com 将其数据系统与 OpenAI 的 LLM 集成,提供更智能的搜索、更快的支持服务以及基于意图的旅行体验,实现规模化个性化。
OpenAI 发布 ChatGPT for Business 2025 年 3 月更新,介绍 ChatGPT 的最新功能。此次更新让 ChatGPT 更加互动,能按团队的工作方式进行定制,并具备智能体(agentic)能力。
Mistral AI 推出 TranscriptToPRDTicket 智能体工作流,由 Mistral Large 2 驱动,可自动将会议记录生成 PRD 并创建开发任务。该流程包含 PRDAgent 和 TicketCreationAgent 两个组件,能在 Linear、Jira 等项目管理工具中自动创建结构化任务票。完整实现已发布在 Google Colab 笔记本中供使用。
Hugging Face 博客讲解如何用 smolagents 构建一个配备 DuckDuckGoSearchTool 和 VisitWebpageTool 的 CodeAgent,并通过 Arize Phoenix 结合 OpenTelemetry + OpenInference 实现对 Agent 每一步调用的实时追踪与调试。
金融分析平台 Endex 使用 OpenAI 的推理模型 o1 和 o3-mini,构建自主金融分析师。该产品由 OpenAI 推理模型驱动,面向金融分析场景。
Adyen 与 Hugging Face 联合发布 DABstep(Data Agent Benchmark for Multi-step Reasoning),包含 450 多个源自 Adyen 真实工作负载的数据分析任务,用于评估 LLM 和 AI 智能体。
Hugging Face 在 OpenAI 发布 Deep Research 后发起 24 小时复现任务,开源智能体框架并在 GAIA 验证集取得 55.15%,高于此前开源框架 SoTA Magentic-One 的约 46%。
推荐理由:原文给出开源复现 Deep Research 的具体架构与 GAIA 得分对比,读者可迁移其 CodeAgent 方法到自己的智能体系统。
OpenAI 推出 deep research,一个用推理能力整合大量网络信息、完成多步研究任务的智能体。即日起面向 Pro 用户开放,Plus 和 Team 用户随后可用。
推荐理由:官方说明了 deep research 的能力定位和开放节奏,读者可以据此了解它面向的用户范围。
Hugging Face 为 smolagents 加入视觉支持,使视觉语言模型可原生用于智能体流程。图像可在 agent.run 启动时传入,也可通过 step_callbacks 在每步动态写入 ActionStep 的 observations_images。
推荐理由:官方详解视觉语言模型如何接入 smolagents 智能体流程,并给出可复用的截图回调和浏览器智能体完整代码。
OpenAI 宣布推出 Operator,原文链接为 https://openai.com/index/introducing-operator。材料正文抓取失败,仅标题可用,产品细节以原文为准。
Hugging Face 概述了 AI 智能体的定义,并分析了其伦理权衡。文章提出,智能体的风险随自主性水平上升:用户让渡的控制越多,安全、隐私等风险越大,并建议不要开发能编写和执行自身代码的完全自主智能体,而半自主智能体的收益可能大于风险。
Hugging Face 发布 smolagents,一个约几千行代码的极简智能体库,支持以代码形式编写动作的 CodeAgent,可通过 E2B 沙箱安全执行,并保留传统 JSON 调用的 ToolCallingAgent。
推荐理由:官方发布并给出代码示例与基准对比,读者可以了解用代码写动作的智能体库如何上手以及何时该用智能体。
Hugging Face 在 Google Cloud 两款 Xeon 实例上评测了 Agentic AI 的文本嵌入与文本生成两类负载。
Mistral AI 宣布对旗下免费 AI 助手 le Chat 进行重大更新,新增带引用的联网搜索、Canvas 创作界面、Agents 自动化工作流,并以免费 beta 形式提供。
推荐理由:官方公布 le Chat 一批免费 beta 功能及与 ChatGPT 等竞品的功能对比表,读者可以据此判断它作为替代方案的位置。
Digital Green 与 Hugging Face Expert Support 合作,为面向小农户的农业问答机器人 Farmer.chat 搭建了 LLM-as-a-judge 评测体系,覆盖提示词清晰度、问题类型、回答率和 RAG 准确性等指标,LLM 评分与约 360 题的人工评估高度相关。
OpenAI 推出 MLE-bench,一个用于衡量 AI 智能体在机器学习工程任务上表现的评测基准。该基准目前仅随发布消息公布,具体评测任务与结果尚未在文中给出。
AI 公司 Altera 使用 GPT-4o 构建智能体与人类协作的全新领域。原文未披露具体产品细节,仅说明 GPT-4o 是其实现这一协作方向的核心模型。