Hugging Face 用 gemma-4-26b-a4b 和 qwen3.6-35b-a3b 本地模型实时分诊 OpenClaw 仓库 PR
Hugging Face 博客介绍了 localpager 系统,用 pi agent harness 加受限只读 shell reposhell,在 NVIDIA GB10(DGX Spark。
推荐理由:作者分享了本地模型加受限 shell 做高吞吐分类的完整配方,附带 330 条评测对比,可迁移到其他信息过滤场景。
Hugging Face 博客介绍了 localpager 系统,用 pi agent harness 加受限只读 shell reposhell,在 NVIDIA GB10(DGX Spark。
推荐理由:作者分享了本地模型加受限 shell 做高吞吐分类的完整配方,附带 330 条评测对比,可迁移到其他信息过滤场景。
三星电子向全球员工部署 ChatGPT Enterprise 和 Codex,这是 OpenAI 规模最大的企业级 AI 部署之一。
ServiceNow 团队在 Hugging Face Blog 发布 MosaicLeaks 基准与 PA-DR 训练方法,研究深度研究智能体通过 web 查询逐步拼出私有文档信息导致的马赛克式隐私泄露。
OpenAI 为 ChatGPT Enterprise 推出全新的支出管控与用量分析功能。此次更新帮助企业更好地管理成本,更有信心地规模化部署 AI。
OpenAI 通过 GPT-5.5 Instant 改进 ChatGPT 的健康与养生类回答,带来更强的推理能力和更好的上下文理解。改进还包括更清晰的沟通表达,以及基于医生参与评估的评测方式。
研究人员使用 OpenAI 推理模型辅助诊断罕见遗传病,在以往未解决的病例中识别出 18 个新诊断。该成果针对的是影响儿童的罕见遗传疾病。
Hugging Face 在 PEFT 库中 added LLM 数学微调和图像生成两个基准,用相同模型、数据、代码和硬件对比 40 多种 PEFT 技术,并追踪 VRAM、遗忘、运行时间和 checkpoint 大小等指标。
推荐理由:Hugging Face 用统一条件的基准实测多种 PEFT 技术,给出 LoRA 并非处处最优的证据和其他技术在两个任务上的具体取舍数据。
Hugging Face 发布 agent-eval 基准工具,不只看最终答案,而是测量智能体完成任务所需的轮次、token、时间和失败情况,全部由开源模型通过 pi 编码智能体驱动并跑在 Hugging Face Jobs 上。
AWS 开源 SDK Strands Robots 将 LeRobot 栈封装为 AgentTools,可用单个 Strands agent 完成录制演示数据、运行策略、部署到实体 SO-101 和多机器人协调。
推荐理由:AWS 官方 walkthrough 给出从 Hub 数据集到实体 SO-101 机器人的完整可运行示例,仿真与硬件共享同一 LeRobotDataset 格式,可迁移到自己的机器人工作流。
OpenAI 与 Molecule.one 展示了一个使用 GPT-5.4 的近自主 AI 化学家,成功改进了一项关键的药物合成反应。这一成果推进了药物化学研究。
智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。
推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。
OpenAI 推出 LifeSciBench,这是一个由领域专家撰写并审阅的基准,用于评估 AI 系统在真实世界生命科学研究任务和决策中的表现。
Hugging Face 联合 Microsoft、Google、GoDaddy 等贡献者发布 Agentic Resource Discovery(ARD)开放规范草案,定义如何通过联邦注册表对 Agent 能力进行编目、索引和自然语言搜索,让 Agent 在运行时发现 MCP 工具、A2A Agent 和 Skills,而无需预先安装配置。
推荐理由:原文介绍了 ARD 开放规范的设计细节和 Hugging Face 的参考实现,附 CLI 和 API 用法,可直接上手做运行时能力发现。
Google DeepMind 正与英国政府、Google Cloud、Faculty 及 Barnet、Dorset、Camden 三个地方规划部门合作,开发基于 Gemini 的 AI 规划原型,目标是把住宅规划申请的决策时间缩短 50%,以支持 2029 年前新建 150 万套住房的目标。
Google 发布 Farmscapes 的矢量化数据集,将英格兰高分辨率地图转化为可操作的树篱、石墙和小片林地清单,用于英国景观修复与碳核算。
Google DeepMind 发布 AI Control Roadmap,把内部 AI 智能体视为潜在未对齐的系统,在对齐之上叠加系统级安全防护。方案基于 MITRE ATT&CK 构建 AI 威胁建模框架,采用可信模型监督器做检测与拦截,并按模型逃避检测和造成危害的能力划分 D1-D4 与 R1-R3 安全等级。
推荐理由:原文提出以模型不可信为前提的系统级 AI Control 框架,并给出检测分级和百万轨迹的落地实践,对构建智能体安全有参考价值。
OpenAI 推出 Deployment Simulation 方法,利用真实对话数据在模型部署前预测其行为,以提升安全性与评测准确性。
英国 AI Security Institute 对齐团队与对齐理论初创公司 Timaeus 的研究人员联合成立非营利研究组织 Sequent,称 ASI 可能几年内出现,现有对齐方法难以在同期就绪。
OpenAI 宣布推出 Partner Network,投入 1.5 亿美元帮助全球合作伙伴加速企业级 AI 的采用、部署与转型。该计划面向全球合作伙伴,重点支持企业在实际业务中落地 AI。
Google Research 分享了关于 AI 皮肤健康工具的消费者研究,其中发表于 JAMA Dermatology 的大规模实验让 2,345 名参与者分三组研究皮肤病例。
OpenAI 在 Academy 推出三门新课程,帮助人们学习实用 AI 技能、建立可复用的工作流,并将智能体应用到日常工作中。课程面向职场场景,聚焦实际操作能力的培养。
Preply 使用 OpenAI 推出 AI 生成的课程总结,提供个性化反馈和语言学习练习。
天体物理学家 Chi-kwan Chan 使用 OpenAI 的 Codex 构建黑洞模拟,帮助科学家研究极端物理现象并检验爱因斯坦广义相对论。Codex 在其科研工作流中承担模拟构建工作,将 AI 编程能力引入天体物理研究。
OpenAI 宣布计划收购 Ona,目标是让 Codex 获得安全、持久的云端环境,支持长时间运行的 AI 智能体在企业工作流中使用。
BBVA 与 OpenAI 合作,将 ChatGPT Enterprise 推广至 10 万名员工,加速全球 AI 银行转型。
Hugging Face 博客发布 PyTorch 性能分析系列第二篇,从 nn.Linear 逐步剖析到 GeGLU MLP 的性能分析。
推荐理由:文章用逐级 profiler 对照讲清 bias 折叠、视图与内核命名,读者可以迁移这套方法去分析自己的 PyTorch trace。
OpenAI 宣布支持 EU Code of Practice on AI content transparency,推进 AI 生成内容溯源标准与工具的发展。此举旨在帮助人们识别和理解 AI 生成内容,为欧洲构建可信 AI 生态提供支持。
OpenAI 模型和 Codex 现可通过 Oracle Cloud 访问,客户可利用现有 Oracle 承诺额度构建和部署 AI,并享有企业级安全与治理能力。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于更敏感、灵活地审计机器遗忘。
Google DeepMind 发布基于文本扩散的开源实验模型 DiffusionGemma,采用 Apache 2.0 协议,权重已在 Hugging Face 上提供。
推荐理由:官方说明了文本扩散模型的架构取舍与适用场景,读者可据此判断它是否适合本地低并发的高吞吐需求。
OpenAI 发布新报告,披露与 PRC 相关的影响行动利用 AI 瞄准美国科技辩论。涉及数据中心叙事、关税话题,以及针对 ChatGPT 的虚假说法。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 并由 Google.org 支持,发起最高 1000 万美元的多智能体 AI 安全研究资助,面向全球研究者。
LSEG 借助 OpenAI 在其全球业务中规模化应用可信 AI,加速洞察产出并缩短发布周期。这些 AI 能力已赋能 4,000 名员工,帮助其更快地从数据中做出决策。
Google DeepMind 发布音频模型 Gemini 3.5 Live Translate,提供 70+ 语言的近实时语音到语音翻译,自动检测语言并保留说话者的语调、节奏和音高,全程仅落后说话者数秒。
推荐理由:官方发布正文给出了 70+ 语言、延迟表现和多端开放入口,读者可据此评估它在通话、会议和翻译场景的可用性。
Google DeepMind 发布 Gemma 4 12B,采用无编码器的统一多模态架构,视觉和音频输入直接进入 LLM backbone,支持原生音频输入。
推荐理由:原文给出了架构细节、内存门槛和许可证等可验证事实,读者可据此评估本地部署多模态模型的可行性。
Google DeepMind 推出 Google DeepMind Accelerator: Robotics 项目,从欧洲选出 15 家早期机器人初创公司,于伦敦启动为期 3 个月的密集辅导和技术支持。
Nextdoor 的工程师使用 Codex 与 GPT-5.5 来调查难以复现的问题、进行跨平台开发,并将精力集中在产品成果上。Codex 帮助他们处理棘手的疑难问题并提升开发效率。
Hugging Face 工程师让一个编码 Agent 通过调用两个 Spaces(ideogram-ai/ideogram4 图像生成和 VAST-AI/TripoSplat 单图转 3D Gaussian splat)搭建了巴黎地标 3D 画廊 mishig/monuments-de-paris,全程未手动使用图像生成或 3D 工具。
推荐理由:作者亲历一次完整流水线复现,给出可复用的 agents.md 调用方法和链式组合思路,读者可照做搭建自己的多媒体 Agent 应用。
Notion 使用 OpenAI 的 Codex 一次性生成规格说明(one-shot specs)、为网页端构建 AI Voice Input 功能,并让小型工程团队的能力成倍放大。
OpenAI 提出面向 AI 时代的产业政策构想,强调以人为本。核心方向包括扩大机会、共享繁荣,以及在先进智能演进过程中构建有韧性的制度。