OpenAI 更新 Model Spec,新增未成年人保护原则
OpenAI 更新其 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应如何基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,明确了模型在更高风险场景下的预期行为,是其改善 ChatGPT 青少年安全工作的延续。
OpenAI 更新其 Model Spec,新增 Under-18 Principles,规定 ChatGPT 应如何基于发展科学为青少年提供安全、适龄的引导。此次更新强化了防护栏,明确了模型在更高风险场景下的预期行为,是其改善 ChatGPT 青少年安全工作的延续。
OpenAI 与美国能源部签署谅解备忘录,深化在 AI 与先进计算领域支持科学发现的合作。该协议建立在双方与国家实验室持续合作的基础上,为 AI 应用于能源部生态内高影响力研究建立框架。
OpenAI 发布新的 AI 素养资源,帮助青少年和家长审慎、安全、有信心地使用 ChatGPT。这些指南包含经专家审核的建议,涵盖负责任使用、批判性思维、健康边界,以及如何支持遇到情绪化或敏感话题的青少年。
OpenAI 发布 GPT-5.2-Codex,称其为目前最先进的编码模型。该模型主打长程推理、大规模代码变换和增强的网络安全能力。
推荐理由:官方说明点出长程推理、大规模代码改造与安全能力三个方向,可作为评估其编码定位的基本参照。
Hugging Face 博客详解 Transformers v5 对分词器的重新设计:将分词器架构(normalizer、pre-tokenizer、算法类型、post-processor、decoder)与训练好的词表和 merges 分离,类似 PyTorch 分离模型结构与权重。
推荐理由:文章来自 transformers 团队,解释 v5 将分词器架构与训练词表分离的设计,便于读者直接检查组件或训练自定义分词器。
Mistral AI 发布 Mistral OCR 3,在表单、扫描件、复杂表格和手写内容上对 Mistral OCR 2 的整体胜率为 74%。模型(mistral-ocr-2512)定价 $2/1000 页,Batch-API 半价至 $1/1000 页,输出支持带 HTML 表格重建的 markdown,并可拖拽 PDF/图片解析为文本或结构化 JSON。
推荐理由:官方给出与上一代的胜率对比、定价和接入方式,读者可以据此评估它在文档解析流程中的成本与适用性。
NVIDIA 以开放评测方式发布 Nemotron 3 Nano 30B A3B,并公开其完整的评测 recipe。该 recipe 基于 NeMo Evaluator 开源库构建,任何人都可以重跑评测流水线、查看配置与产物并独立验证结果。NeMo Evaluator 将多个评测 harness 统一在同一接口下,评测流程与推理后端解耦,并可生成结构化结果与日志以便审计。
Google DeepMind 发布 Gemini 3 Flash,将 Gemini 3 Pro 级推理能力与 Flash 级速度和成本结合。
推荐理由:官方给出关键基准分数、价格和开放渠道,读者可以据此比较它与大模型在速度成本上的取舍。
OpenAI 联合 American Journalism Project 和 The Lenfest Institute 推出 OpenAI Academy for News Organizations 学习中心,帮助新闻编辑室有效使用 AI。该学院提供培训、实际用例和负责任使用指南,支持记者、编辑和出版商在报道与运营中采用 AI。
OpenAI 发布了一份企业 AI 应用现状的数据驱动报告,展示各类组织如何从实验阶段走向真实的生产力提升与新能力。报告聚焦企业采用 AI 的实际路径与成效。
OpenAI 宣布开发者现在可以提交应用供审核并发布到 ChatGPT,通过审核的应用将出现在新的产品内目录中便于发现。更新的工具、指南和 Apps SDK 帮助开发者构建聊天原生体验,将现实世界操作带入 ChatGPT。
推荐理由:官方宣布 ChatGPT 开放应用提交通道和新目录,开发者可据此了解应用上架流程与 Apps SDK 支持情况。
Google DeepMind 发布开源可解释性工具套件 Gemma Scope 2,覆盖 Gemma 3 从 270M 到 27B 的全部模型尺寸,结合稀疏自编码器(SAE)与 transcoder 分析模型内部行为。
OpenAI 推出 FrontierScience 基准,用于测试 AI 在物理、化学、生物学领域的推理能力,衡量其迈向真实科学研究水平的进展。
OpenAI 推出一个真实世界评测框架,衡量 AI 能否加速湿实验室中的生物研究。团队用 GPT-5 优化分子克隆实验方案,同时探讨了 AI 辅助实验的潜力与风险。
OpenAI 宣布推出更快的 ChatGPT Images 体验,并在 API 中发布 GPT-Image-1.5。用户可在 ChatGPT 中体验最新的 ChatGPT Images 2.5。
推荐理由:官方公告点明 ChatGPT Images 更快的新体验和 GPT-Image-1.5 进入 API,读者可据此了解这轮图像功能更新的范围。
OpenAI 发布面向领导者的文章,讲述如何在 AI 时代构建 AI-ready 组织。文章提出四个关键方向:清晰的战略、员工培训、治理体系,以及加速创新。
Google Research 在 STOC 2026 试点 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 在提交后 24 小时内为理论计算机科学论文提供自动反馈。PAT 识别出计算错误、不等式误用和证明逻辑漏洞等问题,97% 的受访作者认为反馈有用并愿意再次使用,88% 希望在整个研究过程中持续使用;工具定位是辅助而非替代同行评审。
推荐理由:官方报告了 STOC 2026 投稿试点中的实测数据与作者反馈,读者可据此了解 AI 辅助审稿在理论数学写作中的实际表现。
IBM Research 宣布开源可配置通用智能体 CUGA 接入 Hugging Face Spaces,提供基于 CRM 场景、含 20 个预配置工具的 Demo。
推荐理由:IBM Research 介绍 CUGA 接入 Hugging Face Spaces,读者可以据此了解其架构能力、开放模型选项和上手路径。
Google DeepMind 发布面向实时语音 Agent 的更新版 Gemini 2.5 Flash Native Audio,提升函数调用、指令遵循与多轮对话能力,在 ComplexFuncBench Audio 上得分 71.5%,开发者指令遵循率从 84% 升至 90%。
推荐理由:官方给出了函数调用、指令遵循的具体提升数据和落地入口,读者可以据此评估现有语音 Agent 是否值得升级。
Google 联合 SisonkeBiotik、Ro'ya 和 DS-I Africa 举办全非健康数据科学 Ideathon,参赛团队基于 Google 开源健康模型 MedGemma、TxGemma 和 MedSigLIP 解决现实健康挑战,从 30 多份提交中选出六支决赛队伍。
OpenAI 仅用 28 天就发布了 Android 版 Sora,全程借助 Codex 完成。团队通过 AI 辅助规划、翻译以及并行编码工作流,以小团队实现了快速、可靠的开发。
BNY 基于 OpenAI 构建企业级 AI 平台 Eliza,推动全公司范围的 AI 应用。超过 20000 名员工通过 Eliza 构建 AI 智能体,以提升效率并改善客户成果。
BBVA 与 OpenAI 启动多年期 AI 转型计划,向全部 12 万名员工推出 ChatGPT Enterprise。双方将共同开发 AI 解决方案,用于改善客户互动、简化运营流程,并打造 AI 原生的银行体验。
llama.cpp server 新增 router mode,无需重启即可动态加载、卸载和切换多个模型,补上类似 Ollama 的模型管理能力。该功能采用多进程架构,单个模型崩溃不影响其他模型;支持自动发现 GGUF 文件、按需加载、LRU 淘汰(默认 --models-max 4)、请求路由和 Web UI 切换。
推荐理由:原文给出 router mode 的加载与切换机制和具体命令选项,读者可以据此评估本地多模型管理的新工作流。
OpenAI 发布 GPT-5.2,称其为迄今数学和科学能力最强的模型,在 GPQA Diamond 和 FrontierMath 等基准上创下新的 SOTA 成绩。文章展示了这些能力提升如何转化为实际研究进展,包括解决一个开放理论问题和生成可靠的数学证明。
推荐理由:原文给出 GPT-5.2 在数学与科学基准上的成绩及其在真实研究中的应用,适合想了解模型推理能力边界的读者。
Google DeepMind 与英国 AI Security Institute(AISI)签署新谅解备忘录,将合作从模型测试扩展到更基础的安全研究。双方将共享专有模型与数据、联合发布报告,重点研究方向包括监测 AI 的链式推理(CoT)过程、研究社会情感对齐问题,以及通过模拟任务评估 AI 对经济系统的长期影响。
迪士尼与 OpenAI 达成协议,将超过 200 个 Disney、Marvel、Pixar 和 Star Wars 角色带入 Sora,供用户生成粉丝创作短视频。协议强调娱乐领域的负责任 AI,并包括迪士尼全公司范围使用 ChatGPT Enterprise 和 OpenAI API。
推荐理由:原文披露协议的核心规模与范围,包括 200 多个角色授权和 Disney 全公司使用 ChatGPT Enterprise,可据此了解这一合作的具体内容。
OpenAI 发布 GPT-5 系统卡更新,介绍 GPT-5 系列最新模型 GPT-5.2。该模型的安全缓解方案与 GPT-5 及 GPT-5.1 系统卡所述基本一致。训练数据涵盖公开互联网信息、第三方合作数据以及用户和人类训练员提供或生成的信息。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验,覆盖数据验证、硬件选择、提交 Hugging Face Jobs、用 Trackio 监控训练、维护训练报告以及用 lighteval 评测。
推荐理由:官方教程给出让 Codex 端到端跑完微调、评测和 GGUF 导出的完整流程与成本参考,方法可直接迁移到自己的实验。
Podium 基于 OpenAI 的 GPT-5 打造了名为“Jerry”的 AI 智能体队友,帮助 Main Street 企业服务客户,实现 300% 的增长,目前已服务超过 10,000 家中小企业(SMBs)。
OpenAI 发布十周年回顾文章,梳理从早期研究突破到被广泛使用的 AI 系统的发展历程。文章分享了过去十年的经验教训,并表示对构建惠及全人类的 AGI 保持乐观。
OpenAI 发布 GPT-5.2,定位为面向日常专业工作的最先进前沿模型,具备推理、长上下文理解、编码和视觉能力。用户可在 ChatGPT 和 OpenAI API 中使用,以驱动更快、更可靠的智能体工作流。
推荐理由:OpenAI 官方说明 GPT-5.2 的能力定位和可用入口,读者可以据此判断是否将其纳入日常工作流。
Google Research 在 COLM 2025 发表 Urania 框架,用差分隐私(DP)从 LLM 聊天机器人对话中提取洞察,提供数学化的端到端隐私保证。框架通过 DP 聚类、DP 关键词提取(三种方法生成关键词)和仅基于匿名关键词的 LLM 摘要生成,确保单条对话不影响输出。评测显示更强隐私设置会降低摘要粒度,但 LLM 评估者最多 70% 的情况更偏好该 DP 框架生成的摘要。
Google DeepMind 于 2025 年 12 月 10 日宣布深化与英国政府的合作,涵盖科学发现、教育、公共服务现代化与国家安全。
OpenAI 表示,随着 AI 模型在网络安全领域的能力增强,公司正在投入更强的防护与防御能力。其做法包括评估风险、限制滥用,并与安全社区合作以增强网络韧性。
Scout24 基于 GPT-5 打造了一个对话式房产搜索助手。该助手通过引导性的澄清提问、内容总结和个性化房源推荐,帮助用户完成房产搜索体验。
Mistral AI 发布开源编码模型 Devstral 2(123B)和 Devstral Small 2(24B),SWE-bench Verified 分别取得 72.2% 和 68.0%,并推出开源终端编码智能体 Mistral Vibe CLI。
推荐理由:官方公布两个尺寸开源编码模型的基准成绩、许可与部署门槛,并同步开放终端 CLI,读者可评估其替代现有方案的成本。
Google DeepMind 与 Kaggle 于 2025 年 12 月 9 日发布 FACTS Benchmark Suite,在原 FACTS Grounding 基础上新增 Parametric、Search 和 Multimodal 三个基准,共 3513 条公开样例,并保留私有评测集由 Kaggle 托管公开排行榜。
OpenAI 宣布联合发起 Linux Foundation 旗下的 Agentic AI Foundation,并捐赠 AGENTS.md,以支持面向安全智能体 AI 的开放、可互操作标准。
推荐理由:OpenAI 官方宣布捐出 AGENTS.md 并参与设立开放标准基金会,读者可以据此跟踪智能体互操作标准的走向。
OpenAI 推出首批 OpenAI Certifications 认证及 AI Foundations 课程,帮助人们学习实用的 AI 技能。课程旨在提升职业机会,并为未来的工作方式做好准备。