AssetOpsBench:弥合 AI 智能体评测与工业现实之间的差距
Hugging Face 推出 AssetOpsBench,一个面向工业资产运维(如冷水机组、空气处理机组)的智能体评测基准,从异常检测、故障诊断、KPI 预测、工单摘要等任务评估智能体。
Hugging Face 推出 AssetOpsBench,一个面向工业资产运维(如冷水机组、空气处理机组)的智能体评测基准,从异常检测、故障诊断、KPI 预测、工单摘要等任务评估智能体。
OpenAI 推出 Edu for Countries 新计划,帮助各国政府利用 AI 现代化教育系统并培养面向未来的劳动力。
OpenAI 最新报告揭示各国在先进 AI 采用上存在显著差异,并推出新举措,帮助各国从 AI 中获取生产力提升。
OpenAI 与盖茨基金会联合启动 Horizon 1000 计划,投入 5000 万美元试点项目,推动 AI 在非洲医疗领域的应用。该计划目标是在 2028 年前覆盖 1000 家诊所。
OpenAI 发布 Stargate Community 计划细节,提出以社区为先的 AI 基础设施建设方式。方案将结合社区意见、能源需求和就业优先事项,因地制宜地进行本地化定制。
Hugging Face 发布系列博客首篇,复盘 DeepSeek R1 发布一年来中国开源 AI 生态的变化。R1 通过 MIT 许可证和公开推理路径降低了技术、采用和心理三重门槛,成为 Hugging Face 史上最受欢迎模型。
ServiceNow 扩大对 OpenAI 前沿模型的接入,在 ServiceNow Platform 上驱动 AI 企业工作流。这些模型将支持摘要、搜索和语音等能力,帮助企业实现 AI 驱动的业务流程。
微软团队(Tianzhu Ye、Li Dong、Yutao Sun、Furu Wei)发布 DIFF Transformer V2,在 DIFF V1 基础上让相减的两个 head 共享同一 GQA 组的 key 和 value,不再增加 KV head,解码速度与标准 Transformer 相当,也无需自定义 attention kernel。
Overworld 发布实时交互式视频扩散模型 Waypoint-1,可通过文本、鼠标和键盘交互生成可进入的虚拟世界。
推荐理由:原文给出训练方法、推理库与帧率数据,并解释它与微调路线世界模型在控制延迟上的差异。
OpenAI 正在 ChatGPT 中推出年龄预测,用于估计账户用户是否年满 18 岁。系统会对疑似未成年用户施加青少年保护措施,并随时间推移持续提升预测准确率。
OpenAI 的商业模式随智能价值同步扩展,涵盖订阅、API、广告、商务和算力等多个板块。这一模式的驱动力来自 ChatGPT 采用的持续深入。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的 encoder-decoder Transformer 框架从普通视频重建动态 3D 场景并追踪时空运动。
OpenAI 宣布 ChatGPT Go 在全球范围内开放。该方案提供更多 GPT-5.2 Instant 访问权限、更高的使用上限和更长的记忆,旨在让先进 AI 更具可负担性。
OpenAI 计划在美国针对 ChatGPT 免费版和 Go 档测试广告,以扩大全球范围内可负担的 AI 访问。官方表示此举将保护用户隐私、信任和回答质量。
Google Research 展示搭载 TCN 架构多输出深度学习模型,仅凭 Pixel Watch 50 Hz IMU 信号和用户身高,即可直接估计步速、步长、双支撑时间、摆动/站立时间等时空步态指标。在 246 名参与者、约 70,000 个步行片段的验证中,多数指标 Pearson r>0.80、ICC>0.80,与手机方案性能相当,且无显著差异(p>0.05)。
OpenAI 宣布投资 Merge Labs,支持新型脑机接口的开发,目标是连接生物智能与人工智能,最大化人类的能力、自主性与体验。
Hugging Face 发布开放推理标准 Open Responses,扩展并开源 OpenAI 的 Responses API,面向 Agent 时代的推理需求。
OpenAI 发布新的 RFP(征集建议书),旨在通过加速美国本土制造来强化美国 AI 供应链。该计划同时着眼于创造就业机会并扩大 AI 基础设施规模。
OpenAI 与 Cerebras 达成合作,新增 750MW 高速 AI 算力,用于降低推理延迟,使 ChatGPT 在实时 AI 工作负载下更快。
Google Research 基于Android Auto的匿名数据验证了急刹车事件(HBE,减速超过 -3m/s²)与路段实际事故率呈显著正相关。分析加州和弗吉尼亚州 10 年事故数据发现,观测到 HBE 的路段数量是记录到事故的 18 倍;加州一条 HBE 率约为州均高速 70 倍的匝道路段位列全路段前 1%。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,提升基于参考图生成视频的表现力、角色身份一致性和背景与对象一致性。
Zenken 在全公司推广 ChatGPT Enterprise 后,销售业绩得到提升,准备时间缩短,提案成功率提高。AI 辅助的工作流程帮助这支精简团队为客户提供更个性化、更有效的沟通。
Google 发布在 Science Advances 的论文,介绍 NeuralGCM 通过直接在 2001 至 2018 年 NASA 卫星降水观测上训练,改进全球降水模拟能力。
Berkeley AI Research 在 NeurIPS 2025 论文中提出一个基于信息含量的成像系统评估与优化框架,仅用噪声测量数据和噪声模型估计互信息。该指标在彩色摄影、射电天文、无透镜成像和显微成像四个领域预测解码器性能,优化后可匹配 SOTA 端到端方法,同时内存和计算量更低,且无需任务专属解码器设计。
OpenAI 与软银集团宣布与 SB Energy 合作,开发多吉瓦级 AI 数据中心园区,其中包含一座支持 Stargate 计划的 1.2 GW 德克萨斯州设施。
推荐理由:合作扩展了 Stargate 的算力与能源布局,读者可以借此了解 AI 数据中心建设对电力供应的依赖程度。
Datadog 使用 OpenAI 的 Codex 对系统级代码进行审查。目前公开信息仅包含 OpenAI 与 Datadog 的品牌联合图片及该合作用途,具体实施细节与效果数据尚未公布。
OpenAI 推出 OpenAI for Healthcare,提供支持 HIPAA 合规的企业级安全 AI 服务。该方案旨在减轻医疗机构的行政负担并支持临床工作流程。
Netomi 借助 GPT-4.1 和 GPT-5.2 将企业级 AI 智能体规模化,结合并发处理、治理与多步推理,支撑可靠的生产工作流。
Tolan 基于 GPT-5.1 构建了语音优先的 AI 伴侣。它结合低延迟响应、实时上下文重建和基于记忆的个性化,实现自然对话。
OpenAI 推出 ChatGPT Health,一个专注健康领域的专属体验,可安全连接用户的健康数据和应用,并配备隐私保护机制。该产品采用由医生参与指导的设计。
NVIDIA 发布 Cosmos Reason 2,一个面向物理 AI 的开源推理视觉语言模型,登顶 Physical AI Bench 和 Physical Reasoning 排行榜,成为视觉理解排名第一的开源模型。
推荐理由:官方发布给出模型规格、上下文长度和评测变化,读者可据此评估其是否适合机器人与视频分析场景。
Hugging Face 博客宣布推出 Falcon-H1-Arabic 阿拉伯语模型家族,包含 3B、7B、34B 三种规格,采用融合 Mamba(State Space Model)与 Transformer 注意力的混合架构。
Hugging Face 发布分步教程,教你在 CES 2026 演示基础上用 NVIDIA DGX Spark 和 Reachy Mini 搭建桌面私人助理。
OpenAI Grove 第二期开放申请,这是一个为期 5 周、面向从想法前到产品各阶段个人的创始人计划。参与者可获得 5 万美元 API 额度、AI 工具早期访问权限,以及 OpenAI 团队的实战指导。
Google 回顾 2025 年在 Google、Google DeepMind 和 Google Research 取得的研究进展:3 月发布 Gemini 2.5。
ServiceNow AI 发布 8B 参数安全护栏模型 AprielGuard,可检测 16 类安全风险以及提示注入、越狱、记忆投毒等对抗攻击,并支持独立提示、多轮对话和含工具调用与推理轨迹的 agentic 工作流输入。
OpenAI 正利用基于强化学习训练的自动化红队持续加固 ChatGPT Atlas,对抗提示词注入攻击。这种主动的"发现—修补"循环可提前识别新型攻击手法,随着 AI 越来越智能体化,不断强化该浏览器智能体的防御能力。
OpenAI 全球客户数已突破 100 万。文中介绍了 PayPal、Virgin Atlantic、BBVA、Cisco、Moderna 和 Canva 等公司如何借助 AI 改变工作方式、为团队赋能并开拓新机会。
Google Research 发布年度回顾,介绍 2025 年在 AI、量子计算与科学发现方面的研究进展。Gemini 3 成为其迄今最强、事实性最好的 LLM,在 SimpleQA Verified 与新发布的 FACTS 基准上达到 SOTA,并在 Gemini 3 中引入可动态生成交互界面的 generative UI;Gemma 多语言扩展至 140+ 种语言。
OpenAI 推出面向思维链(chain-of-thought)可监测性的新框架与评估套件,覆盖 13 项评估、24 个环境。研究结果显示,监测模型内部推理远比只监测输出更有效,为 AI 能力增强下的可扩展控制提供了有前景的路径。