模型路由看似简单实则不然:IBM Research 谈如何把路由当系统优化问题
IBM Research 团队在博文中提出,模型路由不是分类问题而是系统优化问题。他们在 AppWorld Test Challenge 上用同一 CodeAct agent 跑 417 个任务。
推荐理由:作者基于 417 个 AppWorld 任务的一手实测说明标价、缓存和基础设施如何左右路由成本,并把路由从分类问题转为优化问题,方法可迁移。
IBM Research 团队在博文中提出,模型路由不是分类问题而是系统优化问题。他们在 AppWorld Test Challenge 上用同一 CodeAct agent 跑 417 个任务。
推荐理由:作者基于 417 个 AppWorld 任务的一手实测说明标价、缓存和基础设施如何左右路由成本,并把路由从分类问题转为优化问题,方法可迁移。
UC Berkeley 的 Aditya G. Parameswaran 团队发文认为近零成本推理时代将重塑数据系统,提出三类议程:For Agents 重新设计系统以应对智能体高并发重复查询(实验中仅 10-20% 子计划不同)。
Wasmer 使用 Codex(配合 GPT-5.5)构建了一个面向边缘环境的 Node.js 运行时。该方案将开发速度提升 10x 到 20x,原本需要数月的交付缩短至数周。
Hugging Face 发文分析网络安全进入 AI 加速时代后的格局,认为关键在于模型所嵌入的系统而非模型本身,开放生态可在检测、验证、协调、补丁四个阶段分散风险、缩小攻防能力差距。文章主张防御方采用半自主 AI 智能体,配合开源安全工具在组织内部署,并保留人类审批与可审计的决策日志。
推荐理由:原文从 Mythos 出发分析开放生态为何是防御方的结构性优势,并给出半自主智能体的可行防御路线。
OpenAI 发布十周年回顾文章,梳理从早期研究突破到被广泛使用的 AI 系统的发展历程。文章分享了过去十年的经验教训,并表示对构建惠及全人类的 AGI 保持乐观。
MiniMax 团队成员分享 MiniMax M2 后训练中智能体对齐的关键经验。结论包括:智能体需要 Interleaved Thinking,思考可在任务任意阶段发生以应对工具输出等外部扰动。
OpenAI 与 DoorDash 首席人事官 Mariana Garavaglia 对谈,介绍 DoorDash 如何在企业内部扩大 AI 的采用规模,帮助员工更快地构建、学习和创新。
OpenAI 表示,AI 将成为历史上释放机会最多的技术,若发展得当,能给每个人带来前所未有的能力。文中以“务实的科技工作者”视角阐述,强调重视的不是技术本身,而是其对人们生活的直接影响。
OpenAI 与 Canva 联合创始人兼首席产品官 Cameron Adams 展开对谈,探讨 Canva 如何借助 AI 激发用户创造力。
Hugging Face 团队宣布 Gradio 每月有超过 100 万开发者使用,并复盘五年增长经验。核心做法包括以 Gradio Blocks 等低层原语代替高层抽象(gr.Blocks 占 80% 用量)、用 share links 一行代码实现应用传播、聚焦机器学习 Web 应用这一细分场景、不设路线图只做快速迭代,以及让每个应用同时生成 API 端点以便本地部署或程序化调用。
OpenAI 与 LaunchDarkly 首席产品官 Claire Vo 对话,探讨 AI 时代产品经理角色的变化。她分享了构建 AI 原生团队的方法以及自己的"反待办清单"实践。
Hugging Face 发布博客宣布启动 Open-R1 项目,目标是在开放环境下重建 DeepSeek-R1 的数据与训练流程。博客解释了 DeepSeek-R1 基于DeepSeek-V3 的两阶段训练方法,包括 R1-Zero 用 GRPO 纯强化学习训练和 R1 的冷启动微调加多轮 RL 提炼,并指出 DeepSeek 未公开训练数据、训练代码和超参数细节。
经济学家 Tyler Cowen 讲解 OpenAI o1 处理复杂经济学问题的方式,展示该模型在经济学推理任务上的表现。
Cognition 联合创始人兼 CEO Scott Wu 解释了 OpenAI o1 如何以更像人类的方式做出编程决策。
Hugging Face 对话中,Writer 联合创始人兼 CTO Waseem Alshikh 讲述公司从 Hugging Face 用户到客户、再到开源模型贡献者的历程。
OpenAI 发文呼吁现在就开始思考超级智能的治理问题。文章将超级智能定义为能力远超 AGI 的未来 AI 系统,认为眼下是启动相关治理思考的合适时机。
Lilian Weng 在 OpenAI 从事应用 AI 研究工作。
Hugging Face「机器学习总监洞察」系列第四篇,采访 Javier Mansilla、Shaun Gittens、Samuel Franklin 和 Evan Castle 四位机器学习总监。
Hugging Face 机器学习总监洞察系列第三篇聚焦金融行业,访谈来自 U.S. Bank、加拿大皇家银行(RBC)、Moody's Analytics 及前 Bloomberg AI 研究科学家的专家。受访总监指出金融机构面临遗留系统、模型可解释性、客户信任与强监管等挑战,并分享了 ML 在贷款审批等金融决策中引发的信任讨论,以及 KPI 与标签定义错位等常见落地失误。
Hugging Face 推出机器学习总监洞察系列文章,邀请多位在职 ML 总监分享行业观点,覆盖医疗、金融、电商、SaaS、研究、媒体等领域。
Hugging Face 播客采访了机器学习工程师 Lewis Tunstall,他从事 Transformers 应用与 MLOps 工作,并与 Leandro von Werra 合著了《NLP with Transformers》一书。他近期在 transformers 库中开发模型导出 ONNX 格式的功能,一行代码即可完成转换,帮助工程师获得更快延迟和更高吞吐量。
Hugging Face 官方博客解释 Transformers 库有意不采用软件开发的 DRY 原则,而是采用单模型文件策略,即模型前向传播的全部代码集中在一个文件中。
Hugging Face 播客「Machine Learning Experts」采访了曾创立并联合领导 Google Ethical AI 团队的 Margaret Mitchell,她已发表超过 50 篇论文。