Google Research 提出 knowledge profiling:前沿 LLM 事实性瓶颈在召回而非编码
Google Research 提出 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,各配 10 个任务),评估 13 个 LLM 约 450 万条回复。
推荐理由:Google 用知识画像框架把事实错误拆成编码与召回两类,指出前沿模型瓶颈在召回,并量化 thinking 的恢复作用。
Google Research 提出 knowledge profiling 行为框架和 WikiProfile 基准(2,150 条 Wikipedia 事实,各配 10 个任务),评估 13 个 LLM 约 450 万条回复。
推荐理由:Google 用知识画像框架把事实错误拆成编码与召回两类,指出前沿模型瓶颈在召回,并量化 thinking 的恢复作用。
OpenAI 发布研究,展示企业采用 agentic AI 的现状,包括如何使用 ChatGPT 和 Codex,以及前沿企业在 AI 落地上如何领先。
RingCentral 使用 ChatGPT Work 和 Codex 加速 AI 产品开发,并将工程与运维的运营情报集中化,展示其从工程到运维的 AI 原生工作实践。
Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 的实时视频问诊系统,采用 Talker、Planner、Perception 三个智能体并行工作的异步多智能体架构。
推荐理由:原文给出研究架构、随机对照规模和关键结果,读者可以了解视频问诊 AI 与真人医生对比的具体依据和局限。
Microsoft Research 发布研究模型 CARE-X,一个统一的胸部 X 光 VLM,支持报告生成、疾病分类、器械识别、定位等多任务,并结合生成式与判别式双路推理及辅助监督。
IBM Research 在博客中对比自家的 ALTK-Evolve 与 ACE 两种智能体记忆方法,两者都不压缩经验教训,差异在于交付:ACE 每步注入完整 playbook,ALTK-Evolve 按任务和模型能力检索适量 guideline。
Mistral 推出三项主权 AI 举措:Mistral Regional Endpoints 正式可用,客户可选择推理在欧洲或美国运行;Mistral Priority Tier 进入公开预览,提供自定义速率限制和 uptime SLA。
OpenAI 开始在 ChatGPT 中测试广告,目的是支持免费访问。官方称广告将清晰标注、不影响回答独立性,并提供隐私保护与用户控制。
推荐理由:OpenAI 官方说明在 ChatGPT 测试广告的定位与边界,涉及标注、答案独立性和用户控制,可帮助理解其商业化方向。
OpenAI 与 AWS 合作,将 Daybreak 网络安全能力通过 Amazon Bedrock 提供,用于支持企业安全工作流。企业客户现可在 AWS 上使用 Daybreak 模型。
OpenAI CFO Sarah Friar 总结了构建 AI 原生财务职能的五条经验,涵盖自动化预测、更强的财务管控以及 AI 投资回报(ROI)衡量。
NVIDIA 发布 Magpie TTS Multilingual,364M 参数开源权重模型,新增现代标准阿拉伯语、韩语和巴西葡萄牙语,共支持 12 种语言。
OpenAI 向得克萨斯州州长 Greg Abbott 致信,阐述其在得州负责任发展 AI 基础设施的承诺。信中表示支持可靠、透明的基础设施增长,使其惠及得州民众。
Import AI 468 期关注 AI 研究自动化风险:智库 IFP 提出 23 项分属 7 大类的“低悔”政策建议,帮助美国应对 AI R&D 自动化,包括提升透明度、发展 AI 验证技术和增强社会韧性。
Model ML 使用 GPT-5.6 Sol 完成金融工作,覆盖从研究与分析到可编辑、可追溯的 PowerPoint 演示文稿和 Excel 工作簿的全流程。
Hugging Face 论文提出两项系统改动来降低 LLM 知识蒸馏成本:离线缓存 teacher 的 top-100 logits,以及将输出投影融合进损失的 fused chunked KL loss,避免构建全词表 × 序列长度矩阵。
OpenAI 推出网络安全专用模型 GPT-5.6-Cyber,通过 Daybreak Red 面向授权用途提供。该模型支持授权漏洞研究、exploit 验证和安全测试,面向在网络安全攻击窗口收窄背景下扩大 Daybreak 能力的场景。
OpenAI 面向获批的 Daybreak 合作伙伴开放其前沿网络安全模型,用于向客户提供经过授权、受治理的网络安全服务。该计划将模型使用限定在受信任的合规机构范围内。
Virgin Atlantic 使用 ChatGPT Work 加速研究、产品规划和决策。该工具帮助团队连接客户旅程中的各类信号,提升跨环节的洞察效率。
OpenAI 在 ChatGPT Business 上推出 Premium seats。Premium seats 提供 5 倍用量,且没有五小时用量限制。此外还提供灵活的 seat 选项,可满足团队每位成员的需求。
Meta 发布 30B 参数开源多模态模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,定位于本地智能体场景如编码、文档分析和个人助理。
推荐理由:原文给出架构细节、跑分对比和多套部署方案,读者可据此评估其在本地多模态智能体场景的可用性。
Zapier 的企业营销团队使用 ChatGPT Work 来减少销售线索漏斗中的流失、制作营销活动素材并自动化报告流程。ChatGPT Work 帮助该团队改造了其核心营销流程。
OpenAI 公布了 Astra 的初步网络安全评估结果,以及为加强防护措施和安全控制所采取的步骤。此次发布旨在应对关键网络能力面临的下一阶段前沿挑战。
HSP GRUPPE 使用 ChatGPT Enterprise 提升生产力、改善工作质量,为税务咨询和客户服务腾出更多人力。该案例展示了 AI 在税务咨询业务中的实际应用方式。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,单一 AI 模型即可预测气旋路径、强度和风结构,平均多出超过 24 小时的预报提前量,相当于过去 20 年趋势下约十年的气象进步。
推荐理由:Google DeepMind 官方发布并开源了模型权重,读者可以结合 Nature 论文数据评估其对气旋预报工作流的实际改进。
OpenAI 在 ChatGPT 中推出改进版 GPT-5.6 Sol,准确性与一致性更好,并扩大免费用户的使用范围。免费用户还可无限量进行 GPT-5.6 Luna 的日常对话。
OpenAI 与美国心理学会(APA)合作,推进循证指导、资源和安全防护措施,以促进负责任的 AI 使用与青少年心理健康。本次材料仅含摘要,具体合作细节未提供。
Baseten 正式成为 Hugging Face Hub 支持的 Inference Provider,为 Hub 模型页面增强 serverless 推理能力。初始集成支持对话和文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重 LLM。用户可设置自己的 API key 直连或经 HF 路由计费,PRO 用户每月获 $2 推理额度。
OpenAI 发布 OpenAI Signals 数据,展示全球 ChatGPT 使用情况,涵盖国家层面的采用率、使用趋势和用户行为的演变。
OpenAI 说明了近期涉及 OpenAI 模型的第三方网络安全评估事件,并公布了新保障措施。新措施旨在强化 AI 模型的测试与评估流程。
Mistral 发布 3B 开源多模态安全分类模型 Shieldstral,以 Apache 2.0 权重开放下载。它把内容审核建模为策略自适应的问答任务,推理时用自然语言写入审核政策即可返回校准的安全分数,无需重训练,可统一处理文本、图像及提示-回复对。官方称其在文本安全、拒答检测和多模态审核上匹配或超过最大 7 倍于其体积的开源护栏模型,可在单张 16GB GPU 上运行。
OpenAI 为 ChatGPT Work 和 Codex 推出新的教育插件,面向 K–12 教师、高校教师和学生,帮助他们学习、教学、开展研究并进行开发。
OpenAI 就 Apple 提起的诉讼作出回应,称该诉讼缺乏依据,并纠正了其中关于 OpenAI 员工的说法。OpenAI 同时公布了相关消息记录,说明事情经过。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:开源框架把环境层做成可复用服务,并支持直接在真实部署 harness 中训练,为低成本研究智能体提供了可复用的路径。
多伦多大学、Vector Institute、剑桥大学与 ServiceNow 的研究者构建了一个用开源权重 LLM 驱动的自复制计算机蠕虫原型:被攻陷主机的 GPU 上运行 LLM 进行推理,自主发现漏洞并感染新目标,单 GPU(80GB A100)即可运行且不依赖厂商 API。漏洞检测成功率约 80%,利用约 53%,自复制 88%,完整攻击总体成功率约 37%。
OpenAI 介绍了 GPT-Live 的实时语音系统构建过程,耗时六个月完成。GPT-Live 支持与 AI 的连续语音交互,采用 turnless 语音模型和低延迟架构,使对话更快速、更自然。
Circles 使用 OpenAI API 和 Codex 构建 AI 原生电信体验,将 ARPU 提升 22%,流失率降低 9%,并提高了开发效率。
OpenAI 发布了数学与理论计算机科学中长期开放问题的新成果,共十项进展。内容涵盖几何、密码学和复杂性等方向。
OpenAI 分享其在安全性、安保、透明度和内容溯源方面的实践,以支持欧洲的负责任 AI 治理。随着 EU AI Act(欧盟人工智能法案)的推进,相关工作将持续开展。
OpenAI 阐述其全栈(full-stack)路径,目标是让先进 AI 更强大、更可负担、更广泛可用。
保险公司 Univé 通过 ChatGPT Enterprise 构建了 AI 就绪的员工队伍,将领导层推动、负责任的治理与员工自发创新相结合,在大规模范围内实现工作方式转型。