Hugging Face 发布 transformers 到 mlx-lm 的模型移植 Skill 与测试套件
Hugging Face 发布一个 Skill 和独立测试套件,帮助贡献者把 transformers 模型移植到 mlx-lm,模型进入 transformers 后可更快在 MLX 上可用。
推荐理由:原文给出一个可复用的 Skill 加非智能体测试套件,并总结了让智能体 PR 符合开源惯例的具体规则,可迁移到其他项目。
Hugging Face 发布一个 Skill 和独立测试套件,帮助贡献者把 transformers 模型移植到 mlx-lm,模型进入 transformers 后可更快在 MLX 上可用。
推荐理由:原文给出一个可复用的 Skill 加非智能体测试套件,并总结了让智能体 PR 符合开源惯例的具体规则,可迁移到其他项目。
Hugging Face 将 RLVE 框架从单轮推理任务扩展到多轮、带工具调用的电商对话场景,推出 EcomRLVE-GYM,提供 8 个可算法验证的环境,如商品发现、换货、购物车构建、订单追踪等。
Hugging Face 介绍了其推出的可执行基准 VAKRA,用于评估 AI 智能体在企业级环境中的推理与执行能力。基准提供 8,000+ 本地托管 API、覆盖 62 个领域,任务需 3-7 步推理链,包含 API 链式调用、工具选择、多跳推理等四类能力。文章还分析了模型在不同任务上的失败模式。
OpenAI 更新 Agents SDK,新增原生沙盒执行和模型原生 harness,帮助开发者构建可跨文件与工具运行的安全的长时运行智能体。
HCompany 推出 Chrome 扩展 HoloTab,将其 3 月 31 日发布的 computer-use 模型 Holo3 直接带到浏览器中,无需配置即可在任何网站自动化操作。其 Routines 功能通过录屏和讲解生成可重复运行或定时执行的例程,适合比价、找工作等重复任务;产品目前免费开放使用。
推荐理由:原文介绍了浏览器智能体的录制生成例程能力和免费入口,读者可以据此了解它如何把 computer-use 模型带入日常工作流。
Cloudflare 将 OpenAI 的 GPT-5.4 和 Codex 引入 Agent Cloud,帮助企业快速、安全地构建、部署和扩展用于真实任务的 AI 智能体。企业可在 Agent Cloud 上直接运行智能体工作流。
ChatGPT skills 可用于创建可复用的工作流、自动化重复性任务,并确保输出稳定且高质量。
Google Research 推出两个学术智能体框架:PaperVizAgent(原 PaperBanana)用于从论文文本生成可发表的学术图表,ScholarPeer 则自动执行严格的同行评审。
OpenAI 阐述企业 AI 的下一个阶段,称各行业的企业级 AI 采用正在加速。该阶段的核心包括 Frontier、ChatGPT Enterprise、Codex 以及覆盖全公司的 AI 智能体。
Google DeepMind 发布 Gemma 4 开源模型,基于 Gemini 3 技术,主打高级推理和智能体工作流。提供 E2B、E4B、26B MoE(推理时仅激活 3.8B 参数)和 31B Dense 四种尺寸,31B 在 Arena AI 文本排行榜上位列全球开源模型第 3,采用 Apache 2.0 许可,支持 128K-256K 上下文窗口、原生多模态和 140+ 语言。
推荐理由:原文给出了四个尺寸、基准排名和部署细节,读者可以据此判断在本地和端侧硬件上的可用性。
Gradient Labs 基于 GPT-4.1 和 GPT-5.4 mini、nano 构建 AI 智能体,为每位银行客户提供 AI 客户经理,自动化银行支持工作流程。该方案具备低延迟和高可靠性。
Mistral AI 发布面向人类开发者和 Agent 的 Spaces CLI,三条命令即可从零搭建带热重载、数据库和生成 Dockerfile 的多服务项目并部署。
推荐理由:Mistral 以自家 CLI 为例,总结了一套让同一工具同时服务人类与 Agent 的可复用设计原则,细节具体。
Hugging Face 发文称 Anthropic 正在限制 Pro/Max 订阅者在开放智能体平台使用 Claude 模型,并给出两条迁移路径。
Hugging Face 发布端到端语音智能体评估框架 EVA,采用 bot-to-bot 音频架构评估完整多轮语音对话,产出 EVA-A(准确性)与 EVA-X(体验)两项分数。
OpenAI 使用链式思维(chain-of-thought)监控方法,研究内部编码智能体的对齐偏差问题。该方法通过分析真实部署中的智能体行为来检测潜在风险,并据此强化 AI 安全保障措施。
Google Research 在 The Check Up 活动上展示其在医疗健康领域的最新 AI 进展。
Mistral AI 发布 Forge,帮助企业基于内部文档、代码库和运营数据训练前沿级自有模型,并已与 ASML、Ericsson、欧洲空间局等机构合作。Forge 支持 pre-training、post-training 与强化学习,兼容 dense 和 MoE 架构及多模态输入,模型可在企业自有基础设施中运行。
H Company 发布多模态计算机使用模型 Holotron-12B,基于 NVIDIA Nemotron-Nano-2 VL 后训练约 140 亿 token,已在 Hugging Face 以 NVIDIA Open Model License 开放。
Mistral 发布 Leanstral,称其为首个面向 Lean 4 的开源代码智能体,权重采用 Apache 2.0 许可证,提供 120B-A6B 稀疏架构(6B 激活参数),并集成于 Mistral Vibe 及免费 API 端点 labs-leanstral-2603。
Mistral 在开源编码助手 Vibe 之上构建了一个自主 Agent,可读取 Rails 源码并生成或改进 RSpec 测试,在 CI/CD 中无人干预运行。
推荐理由:原文给出可直接复用的 AGENTS.md、skills 与自定义工具做法,以及质量分数变化,方法可迁移到其他代码测试场景。
ChatGPT 通过约束智能体工作流中的高风险操作、保护敏感数据,来防御提示词注入和社工攻击。文章说明了 OpenAI 在 AI 智能体安全设计上的具体做法,帮助降低智能体被恶意指令利用的风险。
OpenAI 介绍了如何基于 Responses API、shell 工具和托管容器构建 Agent 运行时,用于运行带文件、工具和状态的 Agent。方案强调安全性与可扩展性。
OpenAI 推出 AI 应用安全智能体 Codex Security,目前处于研究预览阶段。该智能体通过分析项目上下文来检测、验证并修复复杂漏洞,从而提供更高的置信度和更少的噪音。
Balyasny Asset Management 通过严格的模型评估、全面使用 OpenAI 平台以及智能体工作流,重塑投资研究流程。公司以系统化的模型评测筛选合适的模型,并将 OpenAI 的能力嵌入投研各环节,由智能体自动执行研究任务,构建起一套 AI 驱动的研究引擎。
OpenAI 发布 GPT-5.4,称其为面向专业工作最强、最高效的前沿模型。新模型在编码、计算机使用和工具搜索上达到 SOTA,并提供 1M-token 上下文窗口。
推荐理由:OpenAI 官方给出 GPT-5.4 的能力定位与 1M-token 上下文,可据此判断其在专业工作场景中的可用性。
Amazon Bedrock 推出 Stateful Runtime for Agents,为多步骤 AI 工作流提供持久编排、记忆和安全执行能力。该运行时由 OpenAI 模型驱动,可支持跨步骤保持状态的智能体应用。
OpenAI 与太平洋西北国家实验室(PNNL)联合推出 DraftNEPABench 基准,评估 AI 编程智能体加急联邦审批的能力。该基准显示,AI 有望将 NEPA(国家环境政策法)文件起草时间缩短最多 15%,推动基础设施审查现代化。
OpenAI 宣布推出 Frontier Alliance Partners 计划,帮助企业将 AI 项目从试点阶段推进到生产环境,实现安全、可扩展的智能体部署。
IBM Research 与 UC Berkeley 将 MAST(多智能体系统失败分类法)应用于 ITBench,标注了 310 条由 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 产生的 SRE 执行轨迹,把成功率之外的黑盒失败转成结构化失败签名。
推荐理由:原文把基准的单一成功率拆解为结构化失败模式,并针对三类模型给出对应的工程修复方向。
Hugging Face 官方博客介绍 Gradio 6 中 gr.HTML 支持自定义模板、scoped CSS 和 JavaScript 交互,可让 LLM 一次性生成前端、后端和状态管理都在单个 Python 文件里的应用。
推荐理由:原文由官方讲解 gr.HTML 的模板机制和 API,并结合多类应用示例说明如何用单个 Python 文件构建交互式组件。
OpenAI 与 Paradigm 联合推出 EVMbench,一个评估 AI 智能体能否检测、修补和利用高危智能合约漏洞的评测基准。该基准聚焦智能体在智能合约安全场景下的实际能力。
OpenAI 在 ChatGPT 中推出 Lockdown Mode 和 Elevated Risk 风险标签,帮助组织防御提示词注入和 AI 驱动的数据外泄。
Hugging Face 发布一个随 kernels 库分发的智能体技能,教编码智能体编写可集成进 transformers 和 diffusers 的生产级 CUDA 内核。
推荐理由:原文给出技能安装方法、覆盖内容和 H100 实测数据,读者可以照此让编码智能体生成并发布 CUDA 内核。
Turing 在 Meta 与 Hugging Face 的开源框架 OpenEnv 上构建了生产级日历管理环境 Calendar Gym,用于在访问控制、时间推理和多智能体协调等真实约束下评估工具调用智能体。
OpenAI 技术成员 Ryan Lopopolo 撰文介绍如何在智能体优先的开发模式中利用 Codex,阐述 harness 工程的实践方法。文章来自 OpenAI News,面向希望将 Codex 融入智能体化工作流的工程团队。 (注:正文仅提供了作者署名,摘要主要基于原始标题与来源信息,未添加原文未提及的细节。)
Google Research 在 ACM UIST 2025 上推出开源原型框架 DialogLab,用于编写、模拟和测试动态的人-AI 群组对话。框架通过“author-test-verify”三阶段工作流,将社交设置与对话时间推进解耦,提供拖放画布、human control 模式和可视化验证仪表盘。
Google DeepMind 发布两篇论文,介绍 Gemini Deep Think 在专家指导下解决数学、物理和计算机科学的专业研究问题。其数学研究智能体 Aletheia 配备自然语言验证器并可承认失败,在 IMO-ProofBench Advanced 上最高得分 90%,并自主解决 Bloom's Erdős 猜想数据库中的四个开放问题,包括 Erdős-1051。
推荐理由:原文给出两篇论文的具体成果和方法细节,读者可以了解 AI 辅助科研的实际边界与协作模式。
Google 提出原生自适应界面(NAI)框架,用多模态 AI 让应用 UI 从静态导航转向智能体驱动的动态模块,服务全球 13 亿残障人士。
OpenAI 推出 OpenAI Frontier,一个面向企业的 AI 智能体平台,支持构建、部署和管理智能体。平台提供共享上下文、员工入驻、权限管理和治理功能。
OpenAI 推出 GPT-5.3-Codex,一个 Codex 原生智能体,将前沿编码能力与通用推理相结合,用于支持长周期、真实世界的技术工作。