模型路由看似简单实则不然:IBM Research 谈如何把路由当系统优化问题
IBM Research 团队在博文中提出,模型路由不是分类问题而是系统优化问题。他们在 AppWorld Test Challenge 上用同一 CodeAct agent 跑 417 个任务。
推荐理由:作者基于 417 个 AppWorld 任务的一手实测说明标价、缓存和基础设施如何左右路由成本,并把路由从分类问题转为优化问题,方法可迁移。
IBM Research 团队在博文中提出,模型路由不是分类问题而是系统优化问题。他们在 AppWorld Test Challenge 上用同一 CodeAct agent 跑 417 个任务。
推荐理由:作者基于 417 个 AppWorld 任务的一手实测说明标价、缓存和基础设施如何左右路由成本,并把路由从分类问题转为优化问题,方法可迁移。
OpenAI 提出“反向联邦制”(reverse federalism)的 AI 治理思路,主张各州立法为构建全国性的安全、民主 AI 框架提供基础,通过州与联邦两级行动共同推进美国 AI 安全。
OpenAI 推出自动化红队系统 GPT-Red,通过自博弈(self-play)机制实现鲁棒性的自我提升。该系统用于改进 AI 安全、对齐和提示词注入防御能力。
OpenAI 提出企业在智能体时代应以“每美元产生的有效工作”来衡量 AI 投资回报,通过提升效率、扩大高价值工作流规模来管理 AI 投入。文章面向企业,强调以实际产出而非成本为评估核心。
OpenAI 介绍 ChatGPT Work 在销售场景中的实用工作流,覆盖 pipeline briefs、会议准备、客户账户计划、预测回顾和交易诊断。这些工作流帮助销售团队将 ChatGPT Work 应用到日常销售环节中。
OpenAI 介绍 ChatGPT Work 在数据科学场景的实用工作流,涵盖根因简报、KPI 备忘录、范围明确的数据分析和仪表盘规格四类任务,帮助数据从业者把分析工作交给 ChatGPT 完成。
Deutsche Telekom 正借助 OpenAI 成为 AI 原生电信运营商,将 AI 用于客户服务、员工工作流和网络运营,并探索语音的未来。
OpenAI 发布 ChatGPT 入门指南,讲解如何开始第一次对话。内容涵盖用 AI 进行写作、头脑风暴和解决问题的简单方法。
OpenAI 宣布 GPT-5.6 现已成为 Microsoft 365 Copilot 的首选模型。该模型为 Word、Excel、PowerPoint、Chat 和 Cowork 带来更强的 AI 能力,帮助用户更快完成更高质量的工作。
OpenAI 推出 GPT-5.6,主打更高智能与更强性价比:每个 token 产出更多智能,每美元获得更强性能,并按需提供更强能力以应对最难的工作。
OpenAI 推出 GPT-5.5 Bio Bug Bounty 计划,公布该生物安全赏金项目的相关细节。
OpenAI 官方宣布推出 ChatGPT Work 智能体,可跨用户的应用和文件采取行动,必要时可持续跟进一个项目数小时,把目标变成完成的工作。
推荐理由:官方宣布 ChatGPT 可跨应用与文件执行操作,读者可以据此判断它能承接多长时间的自主项目式工作。
OpenAI 阐述其与政府及国家安全领域合作的方针,提出负责任使用 AI、民主问责与公共安全三项原则。
OpenAI 发布分析,指出流行的编码评测基准 SWE-Bench Pro 存在问题,引发对 AI 模型评估可靠性与准确性的担忧。
OpenAI Academy 与 Walton Family Foundation 联合推出 AI Skills Jams 实践活动,帮助 K-12 教师掌握课堂实用 AI 技能。该培训以动手实践形式进行,面向基础教育工作者。
OpenAI 发布新一代语音模型 GPT-Live,面向更自然的人机交互。该模型现已为 ChatGPT Voice 提供支持。
推荐理由:官方宣布新一代语音模型上线并接入 ChatGPT Voice,读者可据此关注语音交互体验的实际变化。
Australian Payments Plus(AP+)使用 ChatGPT Enterprise 和 Codex 应对支付业务的复杂性,从而加快工作速度。该公司节省了时间、提升了质量,并保持人工判断处于核心地位。
三菱日联金融集团(MUFG)使用 ChatGPT Enterprise 推进 AI 原生组织转型,优化内部工作流程,并大规模提供新的 AI 驱动金融服务。
OpenAI Signals 数据显示 ChatGPT 在全球范围内持续增长,用户使用频率提升,并探索更多功能。增长跨越多个地区和语言。
OpenAI 推出 GeneBench-Pro,一个测试 AI 在基因组学、生物学和科研领域表现的全新基准测试。该基准使用复杂的真实世界数据集来评估 AI 性能。
OpenAI 发布新报告,描绘 AI 如何重塑欧盟就业格局,指出哪些职业可能面临自动化、增长或工作流程变化。
HP Inc. 与 OpenAI 建立 Frontier 战略合作关系,将 AI 部署到客户体验、软件开发和企业运营中。该合作由 HP Inc. 推动扩展,覆盖其核心业务环节。
OpenAI 预览下一代模型 GPT-5.6 Sol,在编程、科学和网络安全方面能力更强。该模型同时配备了 OpenAI 迄今最先进的安全栈。
OpenAI 发布新研究论文,展示 AI 智能体如何改变工作,让更长、更复杂的任务得以完成,并提升各类岗位的生产力。
OpenAI 与 Broadcom 发布定制 AI 芯片 Jalapeño,专为 LLM 推理设计,目标是提升 AI 系统的性能、效率与规模。
GPT-5 Pro 帮助免疫学家 Derya Unutmaz 破解了一项悬置 3 年的免疫学谜题,揭示了 T 细胞行为的关键机制。这一突破有望支持癌症和自身免疫疾病研究。
OpenAI 支持 Appia Foundation,通过评估框架、安全实践和全球合作推动构建高级 AI 的共享标准。
旅行平台 Omio 使用 OpenAI 构建对话式旅行体验,并加速产品开发。公司正借助 OpenAI 转型为 AI 原生企业。
OpenAI 推出 Daybreak 系列安全工具,包括 Codex Security 和 GPT-5.5-Cyber,帮助各类组织大规模查找、验证并修补漏洞。这些工具面向全球企业的安全防护场景。
OpenAI 推出 Patch the Planet,这是 Daybreak 旗下的一项计划,旨在帮助开源维护者借助 AI 和专家评审来发现、验证并修复安全漏洞。
Jason Liu 分享了使用 OpenAI Codex 处理长时间运行任务的经验。他利用 Codex 保存上下文、管理复杂项目,让工作在单个提示词之外持续进行。
三星电子向全球员工部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 规模最大的企业级 AI 部署之一。
OpenAI 为 ChatGPT Enterprise 推出全新的支出管控与用量分析功能。此次更新帮助企业更好地管理成本,更有信心地规模化部署 AI。
OpenAI 通过 GPT-5.5 Instant 改进 ChatGPT 的健康与养生类回答,带来更强的推理能力和更好的上下文理解。改进还包括更清晰的沟通表达,以及基于医生参与评估的评测方式。
研究人员使用 OpenAI 推理模型辅助诊断罕见遗传病,在以往未解决的病例中识别出 18 个新诊断。该成果针对的是影响儿童的罕见遗传疾病。
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家,成功改进了一项关键的药物合成反应。这一成果推进了药物化学研究。
OpenAI 推出 LifeSciBench,这是一个由领域专家撰写并审阅的基准,用于评估 AI 系统在真实世界生命科学研究任务和决策中的表现。
OpenAI 推出 Deployment Simulation 方法,利用真实对话数据在模型部署前预测其行为,以提升安全性与评测准确性。
OpenAI 宣布推出 Partner Network,投入 1.5 亿美元帮助全球合作伙伴加速企业级 AI 的采用、部署与转型。该计划面向全球合作伙伴,重点支持企业在实际业务中落地 AI。
OpenAI 在 Academy 推出三门新课程,帮助人们学习实用 AI 技能、建立可复用的工作流,并将智能体应用到日常工作中。课程面向职场场景,聚焦实际操作能力的培养。