IBM Research 拆解 ALTK-Evolve 与 ACE 的记忆交付差异,同等或更高准确率下大幅降低推理 token 成本
IBM Research 在博客中对比自家的 ALTK-Evolve 与 ACE 两种智能体记忆方法,两者都不压缩经验教训,差异在于交付:ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力检索适量 guideline。
IBM Research 在博客中对比自家的 ALTK-Evolve 与 ACE 两种智能体记忆方法,两者都不压缩经验教训,差异在于交付:ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力检索适量 guideline。
Mistral 推出三项主权 AI 举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,提供自定义速率限制和 uptime SLA。
OpenAI 开始在 ChatGPT 中测试广告,目的是支持免费访问。官方称广告将清晰标注、不影响回答独立性,并提供隐私保护与用户控制。
推荐理由:OpenAI 官方说明在 ChatGPT 测试广告的定位与边界,涉及标注、答案独立性和用户控制,可帮助理解其商业化方向。
OpenAI 与 AWS 合作,将 Daybreak 网络安全能力通过 Amazon Bedrock 提供,用于支持企业安全工作流。企业客户现可在 AWS 上使用 Daybreak 模型。
OpenAI CFO Sarah Friar 总结了构建 AI 原生财务职能的五条经验,涵盖自动化预测、更强的财务管控以及 AI 投资回报(ROI)衡量。
NVIDIA 发布 Magpie TTS Multilingual,364M 参数开源权重模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言。
OpenAI 向得克萨斯州州长 Greg Abbott 致信,阐述其在得州负责任发展 AI 基础设施的承诺。信中表示支持可靠、透明的基础设施增长,使其惠及得州民众。
Model ML 使用 GPT-5.6 Sol 完成金融工作,覆盖从研究与分析到可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿的全流程。
Hugging Face 论文提出两项系统改动来降低 LLM 知识蒸馏成本:离线缓存 teacher 的 top-100 logits,以及将输出投影融合进损失的 fused chunked KL loss,避免构建全词表 × 序列长度矩阵。
OpenAI 推出网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 面向授权用途提供。该模型支持授权漏洞研究、exploit 验证和安全测试,面向在网络安全攻击窗口收窄背景下扩大 Daybreak 能力的场景。
OpenAI 面向获批的 Daybreak 合作伙伴开放其前沿网络安全模型,用于向客户提供经过授权、受治理的网络安全服务。该计划将模型使用限定在受信任的合规机构范围内。
Virgin Atlantic 使用 ChatGPT Work 加速研究、产品规划和决策。该工具帮助团队连接客户旅程中的各类信号,提升跨环节的洞察效率。
OpenAI 在 ChatGPT Business 上推出 Premium seats。Premium seats 提供 5 倍用量,且没有五小时用量限制。此外还提供灵活的 seat 选项,可满足团队每位成员的需求。
Meta 发布 30B 参数开源多模态模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,定位于本地智能体场景如编码、文档分析和个人助理。
推荐理由:原文给出架构细节、跑分对比和多套部署方案,读者可据此评估其在本地多模态智能体场景的可用性。
Zapier 的企业营销团队使用 ChatGPT Work 来减少销售线索漏斗中的流失、制作营销活动素材并自动化报告流程。ChatGPT Work 帮助该团队改造了其核心营销流程。
OpenAI 公布了 Astra 的初步网络安全评估结果,以及为加强防护措施和安全控制所采取的步骤。此次发布旨在应对关键网络能力面临的下一阶段前沿挑战。
HSP GRUPPE 使用 ChatGPT Enterprise 提升生产力、改善工作质量,为税务咨询和客户服务腾出更多人力。该案例展示了 AI 在税务咨询业务中的实际应用方式。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,单一 AI 模型即可预测气旋路径、强度和风结构,平均多出超过 24 小时的预报提前量,相当于过去 20 年趋势下约十年的气象进步。
推荐理由:Google DeepMind 官方发布并开源了模型权重,读者可以结合 Nature 论文数据评估其对气旋预报工作流的实际改进。
OpenAI 在 ChatGPT 中推出改进版 GPT-5.6 Sol,准确性与一致性更好,并扩大免费用户的使用范围。免费用户还可无限量进行 GPT-5.6 Luna 的日常对话。
OpenAI 与美国心理学会(APA)合作,推进循证指导、资源和安全防护措施,以促进负责任的 AI 使用与青少年心理健康。本次材料仅含摘要,具体合作细节未提供。
Baseten 正式成为 Hugging Face Hub 支持的 Inference Provider,为 Hub 模型页面增强 serverless 推理能力。初始集成支持对话和文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重 LLM。用户可设置自己的 API key 直连或经 HF 路由计费,PRO 用户每月获 $2 推理额度。
OpenAI 发布 OpenAI Signals 数据,展示全球 ChatGPT 使用情况,涵盖国家层面的采用率、使用趋势和用户行为的演变。
OpenAI 说明了近期涉及 OpenAI 模型的第三方网络安全评估事件,并公布了新保障措施。新措施旨在强化 AI 模型的测试与评估流程。
Mistral 发布 3B 开源多模态安全分类模型 Shieldstral,以 Apache 2.0 权重开放下载。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入审核政策即可返回校准的安全分数,无需重训练,可统一处理文本、图像及提示-回复对。官方称其在文本安全、拒答检测和多模态审核上匹配或超过最大 7 倍于其体积的开源护栏模型,可在单张 16GB GPU 上运行。
OpenAI 为 ChatGPT Work 和 Codex 推出新的教育插件,面向 K–12 教师、高校教师和学生,帮助他们学习、教学、开展研究并进行开发。
OpenAI 就 Apple 提起的诉讼作出回应,称该诉讼缺乏依据,并纠正了其中关于 OpenAI 员工的说法。OpenAI 同时公布了相关消息记录,说明事情经过。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:开源框架把环境层做成可复用服务,并支持直接在真实部署 harness 中训练,为低成本研究智能体提供了可复用的路径。
OpenAI 介绍了 GPT-Live 的实时语音系统构建过程,耗时六个月完成。GPT-Live 支持与 AI 的连续语音交互,采用 turnless 语音模型和低延迟架构,使对话更快速、更自然。
Circles 使用 OpenAI API 和 Codex 构建 AI 原生电信体验,将 ARPU 提升 22%,流失率降低 9%,并提高了开发效率。
OpenAI 发布了数学与理论计算机科学中长期开放问题的新成果,共十项进展。内容涵盖几何、密码学和复杂性等方向。
OpenAI 分享其在安全性、安保、透明度和内容溯源方面的实践,以支持欧洲的负责任 AI 治理。随着 EU AI Act(欧盟人工智能法案)的推进,相关工作将持续开展。
OpenAI 阐述其全栈(full-stack)路径,目标是让先进 AI 更强大、更可负担、更广泛可用。
保险公司 Univé 通过 ChatGPT Enterprise 构建了 AI 就绪的员工队伍,将领导层推动、负责任的治理与员工自发创新相结合,在大规模范围内实现工作方式转型。
OpenAI 处置了一个总部位于柬埔寨、利用 ChatGPT 支撑诈骗活动的犯罪团伙,涉及投资、杀猪盘、赌博和冒充他人等诈骗手段。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并发布原生维护证据链的自主科研原型 Science One Framework,配套 CoE Audit 自动审计指标。
Hugging Face 撰文指出,AI 的下一个真正约束不是智能而是 GPU 利用率,正如航空业的历史证明决定盈亏的是飞机停场时间而非机队规模。GPU 按日历小时产生融资、折旧、电力和冷却成本,产出却只按计算小时计,企业即便买下集群,也必须解决“如何让 GPU 保持忙碌”的新问题。文章认为利用率几乎取决于所有基础设施决策,是比容量承诺更难解决的问题。
Google DeepMind 发布 Gemini Robotics ER 2,定位为机器人的高层具身推理大脑,可编排 VLA 模型、导航 API 等底层工具完成多步任务。
推荐理由:官方发布详细列出了视频理解、进度追踪、多机协作的量化指标与获取入口,读者可据此评估机器人任务编排能力的变化。
OpenAI 下调 GPT-5.6 中 Luna 和 Terra 两个型号的价格,进一步推进性价比前沿。更高效的 GPT-5.6 模型可帮助企业在更大规模上部署 AI 工作流。
avatarin 利用 OpenAI 的 GPT-Realtime 为 Yamada Denki 购物者提供 24/7 多语言客服支持。上线两周内该智能体已服务 30,000 名用户,92% 的调查反馈为正面评价。
Google DeepMind 发布最新音乐生成模型 Lyria 3.5,已在 Google Flow Music 中开放使用。该模型在音乐性上带来更丰富自然的旋律结构,歌词生成质量和提示词遵循度提升,人声更具表现力且发音更准确,并支持更方便地控制输出节奏和时长。