Google 发布 Project Suncatcher 预印论文,探索基于卫星的可扩展太空 AI 基础设施
Google 发布预印论文,提出 Project Suncatcher 计划,设想在晨昏太阳同步低地球轨道部署搭载 TPU、以自由空间光链路互联的太阳能卫星星座来扩展 AI 算力。
推荐理由:Google 官方给出太空 AI 算力设想的关键数据与验证进展,读者可据此了解星载 TPU、星间光链路与发射成本的具体可行性分析。
Google 发布预印论文,提出 Project Suncatcher 计划,设想在晨昏太阳同步低地球轨道部署搭载 TPU、以自由空间光链路互联的太阳能卫星星座来扩展 AI 算力。
推荐理由:Google 官方给出太空 AI 算力设想的关键数据与验证进展,读者可据此了解星载 TPU、星间光链路与发射成本的具体可行性分析。
Google 发布 provably private insights(PPI)系统,结合 LLM、差分隐私和可信执行环境分析 GenAI 使用数据,保证个体数据不可查看、聚合结果匿名。
OpenAI 深入解析了为 ChatGPT Atlas 浏览器打造的新架构 OWL。OWL 将 Chromium 解耦,实现快速启动和丰富 UI,并支持与 ChatGPT 结合的 agentic 浏览体验。
NVIDIA 推出的 Isaac for Healthcare v0.4 提供 SO-ARM 起始工作流,可端到端构建自主手术辅助机器人:用 SO-ARM101 和 LeRobot 采集仿真与真实遥操作数据,post-train GR00T N1.5,在 Isaac Lab 评估后部署到真实硬件。
Hugging Face 发布 huggingface_hub v1.0,该库现支持 20 万依赖库,并提供超过 200 万公开模型、50 万公开数据集和 100 万公开 Spaces 的访问。
推荐理由:官方完整梳理了 huggingface_hub 五年演进与 v1.0 的破坏性变更,含兼容性影响和迁移指引,对依赖该库的开发者有直接参考价值。
Mistral 发布 Mistral AI Studio,将支撑其自身大规模系统的基础设施打包给企业团队,用于在生产环境构建、评估和运行 AI。平台由三大支柱组成:Observability、基于 Temporal 的 Agent Runtime 和 AI Registry,提供评估、可追溯反馈回路、版本管理与治理能力,并支持混合、专用和自托管部署。
Hugging Face 发布开源 OCR 模型指南,新增 Chandra 和 OlmOCR-2 及其 OlmOCR Benchmark 得分。
推荐理由:指南基于 OlmOCR Benchmark 等公开基准对比了 9 个开源 OCR 模型的格式、大小与成本,并给出按使用场景选型的具体方法。
Intel 与 Hugging Face 在 Google Cloud C4 VM(Intel Xeon 6,代号 Granite Rapids)上对开源 MoE 模型 GPT OSS 进行文本生成基准测试,结果显示相比上一代 C3 VM 实例 TCO 提升 1.7 倍。
Hugging Face 发布教程,介绍用 Optimum Intel 和 OpenVINO 在无 GPU 的 Intel CPU 上本地部署 SmolVLM2-256M-Video-Instruct 的三个步骤:模型转换、量化(权重量化或静态量化)和推理。
OpenAI 与 Broadcom 宣布达成多年期合作,将部署 10 吉瓦 OpenAI 设计的 AI 加速器。双方将共同开发下一代系统和以太网方案,目标是到 2029 年建成可扩展、高能效的 AI 基础设施。
推荐理由:官方宣布的合作明确了 10GW 规模和 2029 年时间线,读者可以据此了解 OpenAI 自研加速器布局的实际部署节奏。
AMD 与 OpenAI 宣布多年战略合作,将部署 6 GW 的 AMD Instinct GPU,首期 1 GW 于 2026 年开始,用于支撑 OpenAI 下一代 AI 基础设施并加速全球 AI 创新。
推荐理由:官方公布多年合作规模与首阶段时间表,读者可据此了解 OpenAI 算力供应的多元布局。
Hugging Face 发布三篇系列的第一部分,记录如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换为端侧运行。dots.ocr 由 1.2B 参数 NaViT 架构视觉编码器和 Qwen2.5-1.5B 主干组成,在 OmniDocBench 上超过 Gemini 2.5 Pro。
OpenAI 打造了内部 AI 销售助手,用来自动化客户调研、会议准备、产品知识和客户跟进。文章展示了这一助手在销售效率与客户成功工作中的实际应用。
Hugging Face 与 Intel 基于 OpenVINO 在 Intel Core Ultra 集成 GPU 上加速 Qwen3-8B:用 Qwen3-0.6B 作草稿模型的投机解码带来约 1.3× 提速,再从草稿模型 28 层中剪掉 6 层并用 Qwen3-8B 生成的 500k 提示词数据微调后,提速提升至约 1.4×。
Scaleway 已正式成为 Hugging Face Hub 支持的 Inference Provider,用户可通过 Hub 直接访问 gpt-oss、Qwen3、DeepSeek R1、Gemma 3 等开源权重模型。
Hugging Face 联合 Cloud Security Alliance 和 Noma Security 推出 RiskRubric.ai,从透明、可靠、安全、隐私、社会安全和声誉六个维度为模型打 0-100 分并折算 A-F 等级。
Public AI Inference Utility 现已成为 Hugging Face Hub 支持的 Inference Provider,让用户可直接访问 Swiss AI Initiative、AI Singapore 等机构的公共模型,例如通过 vLLM 后端调用 swiss-ai/Apertus-70B-Instruct-2509。
Hugging Face 发文介绍为支持 OpenAI GPT-OSS 对 transformers 库的多项升级,包括从 Hub 下载预编译内核、原生 MXFP4 量化、张量并行与专家并行、动态滑动窗口 KV 缓存、Continuous Batching 和更快的模型加载。
推荐理由:Hugging Face 官方详解为支持 gpt-oss 对 transformers 做的各项升级,多数特性可复用到其他模型。
Together AI 与 Hugging Face 宣布新功能,Hub 上任何兼容 LLM 都可用 Together 基础设施微调。
Hugging Face 发文介绍如何在 ZeroGPU Spaces 中用 PyTorch ahead-of-time 编译优化生成式 demo,指出 torch.compile 与 ZeroGPU 短生命周期进程不兼容,需先导出再用 spaces.aoti_* API 编译加载。
推荐理由:原文给出 ZeroGPU 上 AoT 编译的完整步骤和 FP8、动态形状等进阶技巧,读者可以直接迁移到自己的 Spaces demo。
Hugging Face 发布 kernel-builder 使用指南,演示如何从零构建一个 RGB 转灰度的 CUDA kernel,并用 PyTorch C++ API 将其注册为 torch.ops 原生算子。
Arm 宣布 ExecuTorch 0.7 beta 中 KleidiAI 默认启用,为 Arm CPU 设备带来自动加速,无需开发者改代码。
Hugging Face 与 Axolotl 在 Accelerate 中集成了 ND-Parallel,可通过 ParallelismConfig 类任意组合 DP。
OpenAI 在 API 平台推出 GPT-5,面向开发者提供高推理性能和新的控制选项。该模型在真实编码任务上取得同类领先的评测结果。
推荐理由:OpenAI 官方宣布 GPT-5 上线 API,读者可以据此了解其在推理和编码任务上的定位以及面向开发者的新控制能力。
OpenAI 发布 GPT-5 系统卡,说明统一模型路由系统如何在 gpt-5-main、gpt-5-thinking 和轻量版 gpt-5-thinking-nano 之间分配请求,以兼顾快速和智能的响应。各变体针对不同任务和开发者使用场景做了优化。
推荐理由:官方系统卡说明 GPT-5 的统一路由机制,读者可以据此理解不同 gpt-5 变体如何按任务分配响应。
Mistral AI 发布 Codestral 25.08,并整合 Codestral Embed、Devstral 和 Mistral Code IDE 插件形成面向企业的完整编码栈。
OpenAI 分享 Intercom 构建可扩展 AI 平台的三大经验,涵盖评估到架构的实践方法。这些经验帮助 Intercom 在客户支持领域保持领先。
Hugging Face 官方宣布 CLI 从 huggingface-cli 更名为 hf,命令重组为 hf <resource> <action> 的统一格式,认证命令归入 hf auth,旧命令仍可用但会提示弃用。
Hugging Face 宣布 Parquet 内容定义分块(CDC)已在 PyArrow 和 Pandas 中可用,通过 use_content_defined_chunking=True 参数启用,可与其 Xet 存储层配合仅传输变化的数据块。
推荐理由:官方用七类数据变更场景实测 Parquet CDC 与 Xet 的去重效果,读者可据此评估迁移到 CDC 写入对上传下载的实际收益。
Hugging Face 发布教程,介绍结合 Flash Attention 3、torch.compile 和 FP8 量化的 Flux.1-Dev LoRA 推理优化配方,在 H100 上相对基线取得 2.23x 加速,并支持 LoRA 热切换而不触发重编译。
推荐理由:原文给出可直接复用的 LoRA 推理优化配方和 H100、RTX 4090 两套实测延迟数据,并说明热切换避免重编译的限制。
Oracle 与 OpenAI 达成协议,将在美国新增开发 4.5 吉瓦的 Stargate 数据中心容量。OpenAI 称该投资将创造就业、加速美国再工业化,并推动其在 AI 领域的领导地位,是 Stargate 基础设施平台的一个重要里程碑。
推荐理由:官方宣布 Stargate 与 Oracle 新增 4.5 GW 数据中心合作,读者可据此了解 OpenAI 算力扩张的规模与节奏。
NVIDIA NIM 推出单一 Docker 容器,可在 Hugging Face 上快速部署超过 100,000 个 LLM。容器会自动识别模型格式、架构与量化方式(如 FP16、FP8、GGUF、AWQ),并从 NVIDIA TensorRT-LLM、vLLM 和 SGLang 中选择推理后端,无需手动配置。
Hugging Face 宣布 Hub 已从 Git LFS 迁移到 Xet,半年内 500,000 个仓库、20 PB 数据完成迁移,超 100 万用户在使用,5 月起新用户和组织默认启用 Xet。
推荐理由:官方复盘 Hub 从 Git LFS 迁移到 Xet 的完整过程,详解 Git LFS Bridge 与后台迁移机制及规模化踩坑经验。
Hugging Face 发布官方 MCP Server 并撰文复盘其构建过程,通过一个 URL 提供可定制的 Hub 工具接入和数千个 Spaces 应用访问。
推荐理由:官方团队复盘自建 MCP Server 的传输选型与部署权衡,涵盖 Streamable HTTP、无状态配置等可迁移经验。
Hugging Face 发布 Python 库 ScreenEnv,可在 Docker 容器中创建隔离的 Ubuntu 桌面环境,用于测试和部署 GUI 智能体(Computer Use agents)。
推荐理由:原文给出在 Docker 中运行隔离 Ubuntu 桌面环境的用法和 API 与 MCP 两种接入方式,读者可直接复用搭建 GUI 智能体。
Hugging Face 提出机器人异步推理方案,将动作预测与执行解耦:PolicyServer 负责推理,RobotClient 维护动作队列并执行,两者通过 gRPC 通信,比同类 REST API 快约 5 倍。该方案已在 SmolVLA 中引入,任务完成时间提速约 2 倍,成功率相当,使机器人不再等待推理,支持中途重规划和更快的控制循环。
Hugging Face 与 AMD 合作,为在 8 张 MI300X 节点上用 VLLM 以 FP8 部署 Llama 3.1 405B 优化 kernel,包含融合残差连接、RMS norm 与 FP8 转换、融合 SwiGLU 与 FP8 转换、skinny GEMM 三个优化 kernel,显著降低解码延迟。
Hugging Face 基础设施团队分享支撑其生产基础设施的三个关键监控告警:NAT Gateway 高吞吐量告警用于发现异常流量峰值并优化成本(如通过 DNS 覆盖让对象存储访问走私有低成本路径),以及 Hub 请求日志归档成功率告警。
NVIDIA 发布 Llama Nemotron Nano VL,一个面向智能文档处理的 8B 视觉语言模型,已在 Hugging Face 提供下载,并可通过 NVIDIA NIM API 使用。
SGLang 现已支持 Hugging Face transformers 作为推理后端,任何 transformers 兼容模型可开箱获得高性能推理。