OpenAI:AI 时代保持领先的领导力指南
OpenAI 发布面向领导者的文章,讲述如何在 AI 时代构建 AI-ready 组织。文章提出四个关键方向:清晰的战略、员工培训、治理体系,以及加速创新。
OpenAI 发布面向领导者的文章,讲述如何在 AI 时代构建 AI-ready 组织。文章提出四个关键方向:清晰的战略、员工培训、治理体系,以及加速创新。
Google Research 在 STOC 2026 试点 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 在提交后 24 小时内为理论计算机科学论文提供自动反馈。PAT 识别出计算错误、不等式误用和证明逻辑漏洞等问题,97% 的受访作者认为反馈有用并愿意再次使用,88% 希望在整个研究过程中持续使用;工具定位是辅助而非替代同行评审。
推荐理由:官方报告了 STOC 2026 投稿试点中的实测数据与作者反馈,读者可据此了解 AI 辅助审稿在理论数学写作中的实际表现。
IBM Research 宣布开源可配置通用智能体 CUGA 接入 Hugging Face Spaces,提供基于 CRM 场景、含 20 个预配置工具的 Demo。
推荐理由:IBM Research 介绍 CUGA 接入 Hugging Face Spaces,读者可以据此了解其架构能力、开放模型选项和上手路径。
Google DeepMind 发布面向实时语音 Agent 的更新版 Gemini 2.5 Flash Native Audio,提升函数调用、指令遵循与多轮对话能力,在 ComplexFuncBench Audio 上得分 71.5%,开发者指令遵循率从 84% 升至 90%。
推荐理由:官方给出了函数调用、指令遵循的具体提升数据和落地入口,读者可以据此评估现有语音 Agent 是否值得升级。
Google 联合 SisonkeBiotik、Ro'ya 和 DS-I Africa 举办全非健康数据科学 Ideathon,参赛团队基于 Google 开源健康模型 MedGemma、TxGemma 和 MedSigLIP 解决现实健康挑战,从 30 多份提交中选出六支决赛队伍。
OpenAI 仅用 28 天就发布了 Android 版 Sora,全程借助 Codex 完成。团队通过 AI 辅助规划、翻译以及并行编码工作流,以小团队实现了快速、可靠的开发。
BNY 基于 OpenAI 构建企业级 AI 平台 Eliza,推动全公司范围的 AI 应用。超过 20000 名员工通过 Eliza 构建 AI 智能体,以提升效率并改善客户成果。
BBVA 与 OpenAI 启动多年期 AI 转型计划,向全部 12 万名员工推出 ChatGPT Enterprise。双方将共同开发 AI 解决方案,用于改善客户互动、简化运营流程,并打造 AI 原生的银行体验。
llama.cpp server 新增 router mode,无需重启即可动态加载、卸载和切换多个模型,补上类似 Ollama 的模型管理能力。该功能采用多进程架构,单个模型崩溃不影响其他模型;支持自动发现 GGUF 文件、按需加载、LRU 淘汰(默认 --models-max 4)、请求路由和 Web UI 切换。
推荐理由:原文给出 router mode 的加载与切换机制和具体命令选项,读者可以据此评估本地多模型管理的新工作流。
OpenAI 发布 GPT-5.2,称其为迄今数学和科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上创下新的 SOTA 成绩。文章展示了这些能力提升如何转化为实际研究进展,包括解决一个开放理论问题和生成可靠的数学证明。
推荐理由:原文给出 GPT-5.2 在数学与科学基准上的成绩及其在真实研究中的应用,适合想了解模型推理能力边界的读者。
Google DeepMind 与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到更基础的安全研究。双方将共享专有模型与数据、联合发布报告,重点研究方向包括监测 AI 的链式推理(CoT)过程、研究社会情感对齐问题,以及通过模拟任务评估 AI 对经济系统的长期影响。
迪士尼与 OpenAI 达成协议,将超过 200 个 Disney、Marvel、Pixar 和 Star Wars 角色带入 Sora,供用户生成粉丝创作短视频。协议强调娱乐领域的负责任 AI,并包括迪士尼全公司范围使用 ChatGPT Enterprise 和 OpenAI API。
推荐理由:原文披露协议的核心规模与范围,包括 200 多个角色授权和 Disney 全公司使用 ChatGPT Enterprise,可据此了解这一合作的具体内容。
OpenAI 发布 GPT-5 系统卡更新,介绍 GPT-5 系列最新模型 GPT-5.2。该模型的安全缓解方案与 GPT-5 及 GPT-5.1 系统卡所述基本一致。训练数据涵盖公开互联网信息、第三方合作数据以及用户和人类训练员提供或生成的信息。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验,覆盖数据验证、硬件选择、提交 Hugging Face Jobs、用 Trackio 监控训练、维护训练报告以及用 lighteval 评测。
推荐理由:官方教程给出让 Codex 端到端跑完微调、评测和 GGUF 导出的完整流程与成本参考,方法可直接迁移到自己的实验。
Podium 基于 OpenAI 的 GPT-5 打造了名为“Jerry”的 AI 智能体队友,帮助 Main Street 企业服务客户,实现 300% 的增长,目前已服务超过 10,000 家中小企业(SMBs)。
OpenAI 发布十周年回顾文章,梳理从早期研究突破到被广泛使用的 AI 系统的发展历程。文章分享了过去十年的经验教训,并表示对构建惠及全人类的 AGI 保持乐观。
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的最先进前沿模型,具备推理、长上下文理解、编码和视觉能力。用户可在 ChatGPT 和 OpenAI API 中使用,以驱动更快、更可靠的智能体工作流。
推荐理由:OpenAI 官方说明 GPT-5.2 的能力定位和可用入口,读者可以据此判断是否将其纳入日常工作流。
Google Research 在 COLM 2025 发表 Urania 框架,用差分隐私(DP)从 LLM 聊天机器人对话中提取洞察,提供数学化的端到端隐私保证。框架通过 DP 聚类、DP 关键词提取(三种方法生成关键词)和仅基于匿名关键词的 LLM 摘要生成,确保单条对话不影响输出。评测显示更强隐私设置会降低摘要粒度,但 LLM 评估者最多 70% 的情况更偏好该 DP 框架生成的摘要。
Google DeepMind 于 2025 年 12 月 10 日宣布深化与英国政府的合作,涵盖科学发现、教育、公共服务现代化与国家安全。
OpenAI 表示,随着 AI 模型在网络安全领域的能力增强,公司正在投入更强的防护与防御能力。其做法包括评估风险、限制滥用,并与安全社区合作以增强网络韧性。
Scout24 基于 GPT-5 打造了一个对话式房产搜索助手。该助手通过引导性的澄清提问、内容总结和个性化房源推荐,帮助用户完成房产搜索体验。
Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。
推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。
Google DeepMind 与 Kaggle 于 2025 年 12 月 9 日发布 FACTS Benchmark Suite,在原 FACTS Grounding 基础上新增 Parametric、Search 和 Multimodal 三个基准,共 3513 条公开样例,并保留私有评测集由 Kaggle 托管公开排行榜。
OpenAI 宣布联合发起 Linux Foundation 旗下的 Agentic AI Foundation,并捐赠 AGENTS.md,以支持面向安全智能体 AI 的开放、可互操作标准。
推荐理由:OpenAI 官方宣布捐出 AGENTS.md 并参与设立开放标准基金会,读者可以据此跟踪智能体互操作标准的走向。
OpenAI 推出首批 OpenAI Certifications 认证及 AI Foundations 课程,帮助人们学习实用的 AI 技能。课程旨在提升职业机会,并为未来的工作方式做好准备。
OpenAI 任命 Denise Dresser 为首席营收官,负责公司面向企业与客户成功的全球营收战略。她将帮助更多企业把 AI 应用于日常运营,助力 OpenAI 持续扩展规模。
Commonwealth Bank of Australia 与 OpenAI 合作,向 50,000 名员工推出 ChatGPT Enterprise,在全行规模上培养 AI 应用能力。此举旨在改善客户服务并提升欺诈响应效率。
OpenAI 与 Deutsche Telekom 合作,为欧洲数百万用户提供先进的多语言 AI 体验。ChatGPT Enterprise 还将部署给 Deutsche Telekom 员工,帮助其优化工作流程并加速创新。
OpenAI 与 Instacart 深化长期合作,将首个完全集成的杂货购物与 Instant Checkout 支付应用带入 ChatGPT。
OpenAI 基于 2025 年企业数据发布《企业 AI 现状》报告,指出各行业 AI 采用正在加速、集成程度加深,并带来可量化的生产力提升。报告揭示了企业 AI 在 2025 年加速普及与更深整合的关键发现。
Virgin Atlantic CFO Oliver Byers 分享了这家航空公司如何使用 AI 加速开发、改善决策并提升客户体验,将 AI 应用于旅行的每一个环节。
Hugging Face 推出 Swift 软件包 swift-huggingface,为 Hugging Face Hub 提供完整客户端,后续将集成进 swift-transformers 替换其 HubApi 实现。
Google Research 在两篇新论文中推出 Titans 架构和 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合。Titans 用多层感知机作为神经长期记忆模块,通过“惊喜度量”(surprise metric)在运行时选择性存储意外信息,并辅以动量和自适应遗忘机制,实现无需离线重训练的测试时记忆。
OpenAI 推出 OpenAI for Australia 计划,将在澳大利亚建设主权 AI 基础设施。该计划还将为超过 150 万名劳动者提供技能提升培训,并加速澳大利亚 AI 生态系统的创新发展。
Google DeepMind 介绍 Michigan State University 的 Berkley Walker 团队利用 AlphaFold 预测光合作用关键酶 glycerate kinase(GLYK)的 3D 结构。
Intel AI 软件团队推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调并通过 smolagents 实现的数学推理智能体。模型用简短 Python 代码片段替代冗长文本推理,在沙箱中执行后回填推理上下文,输出长度最多减少 66%,同时常提升准确率。在 MATH500、AIME、HMMT、HLE 四个数据集上,GRPO 训练与智能体推理结合取得最高准确率。
Hugging Face 推出 hf-llm-trainer 技能,让 Claude Code、Codex、Gemini CLI 等编码智能体可自动选择 GPU、生成脚本、向 Hugging Face Jobs 提交微调任务并用 Trackio 监控进度,完成后模型自动推送到 Hub。
推荐理由:官方发布了让 Claude Code 等编码智能体端到端微调开源模型的 hf-llm-trainer 技能,覆盖 GPU 选择、任务提交到监控的完整流程。
Google Research 发布声音嵌入基准 MSEB,已在 NeurIPS 2025 上展示。该基准统一评估检索、推理、分类、转写、分割、聚类、重排序、重构 8 项听觉能力,核心数据集 SVQ 包含 177,352 条口语查询,覆盖 26 个地区和 17 种语言,已在 Hugging Face 开源。初始实验显示,现有声音表示远非通用,全部 8 项任务仍存在较大性能提升空间。
OpenAI 研究人员正在测试一种名为“忏悔(confessions)”的方法,训练模型主动承认自己的错误或不当行为,以提升 AI 的诚实性、透明度和模型输出的可信度。
OpenAI 宣布收购 Neptune,以深入了解模型行为,并加强研究人员用于跟踪实验和监控训练的工具。