跳到正文

#部署/工程

今日 4 条
9月3日周四
  1. Google DeepMind43

    Google DeepMind 推出 Fairwind 计划:以 Gemini 3.8 Flash Cyber 提供主动网络防御

    Google DeepMind 推出 Fairwind 计划,向政府机构和受信任的合作伙伴开放先进的网络防御能力。该计划将 Gemini 3.8 Flash Cyber 模型与 CodeMender 结合,可自主查找、验证并修复漏洞,在几分钟内生成就绪的补丁,初始访问面向政府、关键基础设施运营商和核心技术平台。

9月1日周二
  1. Hugging Face Blog60

    Hugging Face 发布 @huggingface/kernels 及 207 个 WebGPU 内核

    Hugging Face WebAI 团队发布 @huggingface/kernels 库和 207 个 WebGPU 内核(Apache-2.0),每个内核以带版本号的独立仓库发布,包含 manifest、正确性测试、基准用例和 WGSL shader 模板。

    推荐理由:官方介绍了 207 个 WebGPU 内核的发布方式和与 ORT WebGPU 的实测对比,读者可以据此评估浏览器端推理优化的可用路径。

8月26日周三
8月25日周二
  1. Hugging Face Blog69

    Gradio 推出 gr.Workflow:把 AI 流水线变成可拖拽的节点图界面

    Hugging Face 在 Gradio 中推出 gr.Workflow,把 AI 应用的多步骤流水线描述为类型化节点图,并提供可拖拽画布,每个节点可运行、中间结果可见。

    推荐理由:原文来自官方,给出 gr.Workflow 的节点图机制、多个可复制的在线示例和 REST API 用法,读者可以直接上手复用这套搭建 AI 流水线的方法。

8月21日周五
  1. Hugging Face Blog66

    Liquid AI 发布 LFM2.5-DSpark 草稿模型,推理最高提速 3.2x

    Liquid AI 为 LFM2.5 系列三个模型(LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B)发布 DSpark 草稿模型检查点,采用投机解码在不改变输出质量的前提下大幅加速解码。

    推荐理由:官方给出 DSpark 草稿模型的具体加速数据、质量等价原理和 llama.cpp 与 SGLang 的用法,端侧部署可直接迁移。

8月19日周三
8月18日周二
  1. Hugging Face Blog39

    Hugging Face:同一集群利用率提升 33 个百分点——改变的只是分配顺序

    Hugging Face 构建了一个约束感知 GPU 分配器,在 7 个基准场景中与 FIFO 调度器对比。相同硬件和负载下,利用率从 52–85% 提升至 72–88%,最高提升 33 个百分点;优先级加权产出每个场景均上升,增幅 24.6%–105.1%,平均 52%。最强案例是 8 GPU 的训练密集型负载:利用率从 53.6% 升至 87.0%,产出提升 105%。

8月14日周五
8月11日周二
8月6日周四
  1. Hugging Face Blog45

    Baseten 入驻 Hugging Face Inference Providers

    Baseten 正式成为 Hugging Face Hub 支持的 Inference Provider,为 Hub 模型页面增强 serverless 推理能力。初始集成支持对话和文本生成任务,可调用 Kimi K3、DeepSeek V4 Flash、GLM-5.2 等开放权重 LLM。用户可设置自己的 API key 直连或经 HF 路由计费,PRO 用户每月获 $2 推理额度。

7月30日周四
  1. Hugging Face Blog35

    GPU 管理:为何闲置 GPU 是新的“停飞客机”

    Hugging Face 撰文指出,AI 的下一个真正约束不是智能而是 GPU 利用率,正如航空业的历史证明决定盈亏的是飞机停场时间而非机队规模。GPU 按日历小时产生融资、折旧、电力和冷却成本,产出却只按计算小时计,企业即便买下集群,也必须解决“如何让 GPU 保持忙碌”的新问题。文章认为利用率几乎取决于所有基础设施决策,是比容量承诺更难解决的问题。

7月29日周三
7月27日周一
7月23日周四
  1. Hugging Face Blog66

    Diffusers 原生集成 Nunchaku Lite,支持 4-bit SVDQuant 扩散模型推理

    Hugging Face 宣布 Diffusers 原生支持 Nunchaku 的 SVDQuant 4-bit 推理,通过 Nunchaku Lite 集成路径直接用 from_pretrained() 加载量化 checkpoint,无需独立推理引擎或本地 CUDA 编译。

    推荐理由:Diffusers 原生集成 Nunchaku,W4A4 量化在降显存的同时也降低推理延迟,是可复现的部署方案变化。

7月22日周三
7月16日周四
  1. Hugging Face Blog67

    模型路由看似简单实则不然:IBM Research 谈如何把路由当系统优化问题

    IBM Research 团队在博文中提出,模型路由不是分类问题而是系统优化问题。他们在 AppWorld Test Challenge 上用同一 CodeAct agent 跑 417 个任务。

    推荐理由:作者基于 417 个 AppWorld 任务的一手实测说明标价、缓存和基础设施如何左右路由成本,并把路由从分类问题转为优化问题,方法可迁移。

7月10日周五
7月9日周四
  1. Mistral AI41

    Mistral Studio 为 Prompts 与 Skills 提供系统化记录管理

    Mistral 推出 Studio,为企业的 Prompts 与 Skills 提供统一的 system of record,实现版本化、明确归属和全程可追溯。每个资产拥有不可变版本、审计日志和分类标签,支持快速迭代与受控上线,业务人员无需工程师也能直接改进生产指令。该功能现已向 Mistral Studio 客户开放,Skills 可作为 MCP servers 从 Studio 直接调用。

7月8日周三
7月7日周二
  1. Hugging Face Blog60

    Hugging Face 模型登陆 Microsoft Foundry Managed Compute

    Microsoft 在 Build 2026 上推出 Foundry Managed Compute,并在 Foundry 模型目录中上线 Hugging Face 精选模型集,数以千计的开源权重模型每周更新,可一键部署到 NVIDIA A100、H100 或 AMD MI300X 加速器。

    推荐理由:原文来自双方官方博客,详细说明了精选目录、curation 流程、运行时选择和部署模板,读者可以据此评估在 Foundry 上部署开源模型的实际路径。

  2. Hugging Face Blog61

    SkyPilot 与 Hugging Face 推出 store: hf,任意云端 GPU 可零 egress 读取 Hub 存储

    SkyPilot 与 Hugging Face 联合推出 store: hf,用一条 hf:// URL 即可将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,作业可调度到 20+ 云、Kubernetes 和本地集群。

    推荐理由:原文给出 hf:// 挂载、零 egress 读费与 Xet 去重的具体数字,读者可据此评估多云 GPU 任务的数据存储方案。

7月6日周一
  1. Hugging Face Blog53

    Hugging Face Kernels 项目大版本更新:新增 kernel 仓库类型、签名机制与智能体开发支持

    Hugging Face 官方博客总结 🤗 Kernels 项目近几个月的重大更新。Hub 新增 kernel 仓库类型,可查看内核支持的加速器、操作系统和后端版本;默认只加载受信任发布者的内核,非受信来源需显式传 trust_remote_code=True,并引入基于 Sigstore cosign 的代码签名(加载时尚未默认验证)。

7月1日周三
6月26日周五
  1. Hugging Face Blog66

    Hugging Face 教你一条命令在 HF Jobs 上运行 vLLM 服务器

    Hugging Face 发布教程,用一条 hf jobs run 命令即可在 HF 基础设施上启动私有 OpenAI 兼容的 vLLM 端点,无需配置服务器或 Kubernetes,按秒计费(a10g-large 为 $1.50/hour)。

    推荐理由:官方教程给出一条命令在 HF Jobs 上起 vLLM 服务的完整路径,含定价、权限、SSH 调试和接 coding agent 等可复用细节。

6月25日周四
6月24日周三
6月23日周二
  1. Mistral AI68

    Mistral 发布 OCR 4,新增边界框、块分类与置信度分数,支持 170 种语言

    Mistral 发布 Mistral OCR 4,除文本外返回边界框、分类型块(标题、表格、公式、签名等)和逐页逐词置信度分数,支持 10 个语系下 170 种语言。

    推荐理由:官方公布了能力细节、定价和基准方法论,还主动列出自动评测的打分缺陷,读者可据此判断在自己场景中怎么用。

  2. Hugging Face Blog68

    Hugging Face 讲解如何用开源模型和 GitHub Actions 把 huggingface_hub 改为每周发布

    Hugging Face 在官方博客详解如何把 huggingface_hub 的发布节奏从每 4 到 6 周一次提升到每周一次,整条流程跑在一个 GitHub Actions 工作流里,使用开源工具、开源权重模型(当前为 Z.ai 的 GLM-5.2)和 HF Inference Providers,单次发布的模型成本约 $0.25。

    推荐理由:Hugging Face 官方复盘自身发布流水线,给出可复用的确定性校验加人工把关模式,其他开源维护者可以照搬适配。

6月22日周一
6月17日周三
  1. Hugging Face Blog64

    AWS Strands Robots 集成 LeRobot:从 Hugging Face Hub 数据集到实体机器人硬件

    AWS 开源 SDK Strands Robots 将 LeRobot 栈封装为 AgentTools,可用单个 Strands agent 完成录制演示数据、运行策略、部署到实体 SO-101 和多机器人协调。

    推荐理由:AWS 官方 walkthrough 给出从 Hub 数据集到实体 SO-101 机器人的完整可运行示例,仿真与硬件共享同一 LeRobotDataset 格式,可迁移到自己的机器人工作流。

6月11日周四