Groq 接入 Hugging Face Inference Providers
Hugging Face 宣布 Groq 成为 Hub 上的 Inference Provider,可直接在模型页和 JS、Python 客户端 SDK 中调用 Groq 托管的开源模型,包括 Meta 的 Llama 4 和 Qwen 的 QWQ-32B。
Hugging Face 宣布 Groq 成为 Hub 上的 Inference Provider,可直接在模型页和 JS、Python 客户端 SDK 中调用 Groq 托管的开源模型,包括 Meta 的 Llama 4 和 Qwen 的 QWQ-32B。
TNG 在 24 块 H100 GPU 集群上自托管多个 LLM,日均消耗超 1 亿 token、生成超 1000 万 token。文章分析 vLLM 默认 chunked-prefill 策略下长提示词会阻塞队列:prefill 各请求只能顺序执行,导致后续请求首 token 等待时间变长。
Hugging Face 官方博客介绍 Kernel Hub,开发者可通过 kernels 库的 get_kernel 一行代码加载预编译的优化计算内核,自动匹配 Python、PyTorch 和 CUDA 版本。
推荐理由:原文给出从加载到基准测试的完整可复现步骤,读者可据此评估把优化内核接入自己模型的实际收益。
Featherless AI 成为 Hugging Face Hub 支持的 Inference Provider,用户可在模型页面直接使用其 serverless 推理服务。
NVIDIA 发布 Isaac GR00T N1.5——首个开源通用人形机器人基础模型 GR00T N1 的首次重大更新,并提供用 LeRobot SO-101 机械臂遥操作数据进行微调的完整教程。
Mistral AI 发布 Mistral Compute,向客户提供私有集成 AI 基础设施,涵盖 GPU、编排、API、产品和服务,形态从裸金属服务器到全托管 PaaS。作为 NVIDIA 合作伙伴,初期提供数万块 GPU 并计划快速扩张,面向欧洲、中东、亚洲及南半球的主权、企业和研究机构,强调数据主权、欧洲合规与脱碳能源,已有 Orange、BNP Paribas、Thales 等启动伙伴。
Hugging Face 与 NVIDIA 在 GTC Paris 上宣布推出 Training Cluster as a Service,让全球研究机构可按需申请 GPU 集群并只为训练运行时长付费。
Mistral 发布 Mistral Code,一款面向企业开发团队的 AI 编程助手,基于开源项目 Continue 打造,今日面向 JetBrains IDE 和 VSCode 开放 private beta,GA 即将推出。
Hugging Face 在 TRL v0.18.0 通过 PR #3394 引入 vllm_mode="colocate",让 vLLM 不再以独立 HTTP 服务器运行,而是嵌入同一分布式进程组,与 GRPO 训练共享同一批 GPU,消除训练与生成之间的互相等待。
Hugging Face 发布研究,让 CodeAgent 以强制 JSON 结构同时生成 thoughts 和 code,在 GAIA、MATH、SimpleQA、Frames 等基准上比常规 CodeAgent 平均高出 2-7 个百分点。
推荐理由:原文给出结构化输出结合 CodeAgent 的实测数据与适用边界,读者可据此判断自己的模型规模是否适合启用该方案。
Hugging Face 与 Dell 在 Dell Tech World 上发布新版 Dell Enterprise Hub,提供模型与应用套件,可在 Dell AI 服务器和 AI PC 上本地部署 AI。
OpenAI 推出 Stargate UAE,这是其 AI 基础设施平台 Stargate 的首次国际部署。
推荐理由:官方宣布 Stargate 首次落地海外,读者可从中了解 OpenAI 基础设施出海的动向。
Hugging Face 发布 Diffusers 量化后端解读文章,以 black-forest-labs/FLUX.1-dev 为例实测 bitsandbytes、torchao、Quanto、GGUF 和 FP8 Layerwise Casting 五种方案。
推荐理由:文章系统对比了 Diffusers 各量化后端在 Flux-dev 上的内存、速度与画质差异,并给出选型建议和可复现代码。
Hugging Face 宣布 Transformers 将成为跨框架的模型定义标准,现支持 300+ 架构,平均每周新增约 3 个,并为 Llama、Qwen、GLM 等热门架构提供 day-0 支持。
推荐理由:Hugging Face 官方说明 Transformers 转型为跨框架模型定义标准,读者可以据此判断训练与推理工具链如何围绕它互通。
Hugging Face 在 Inference Endpoints 上推出新的 OpenAI Whisper 部署选项,推理由 vLLM 驱动,Whisper Large V3 的 RTFx 较此前提升近 8x 且转写质量无损失。
OpenAI 面向亚洲客户推出数据驻留功能,扩展其企业级数据隐私、安全与合规项目,支持全球客户。
Mistral 发布 Le Chat Enterprise,由新模型 Mistral Medium 3 驱动,针对工具碎片化、知识集成不安全、模型僵化和 ROI 慢等企业痛点提供统一平台。
Mistral AI 发布 Mistral Medium 3,在多项基准上达到或超过 Claude Sonnet 3.7 的 90% 表现,定价为 $0.4 输入 / $2 输出每 M token,并称超越 Llama 4 Maverick 与 Cohere Command A。
推荐理由:官方给出与 Claude Sonnet 3.7 对比的基准成绩、定价和部署选项,读者可据此评估企业落地的性价比。
Intel 推出 AutoRound,一种 weight-only 后训练量化方法,通过符号梯度下降联合优化权重取整和截断范围,支持 INT2 至 INT8 低比特量化。
TNG 在 Hugging Face 博客发布 LLM 性能系列第二篇,讲解 prefill 与 decode 两个阶段对延迟、吞吐和 GPU 利用率的影响,并比较 static batching、continuous batching 和 prefill-first 等并发策略。
Hugging Face 官方博客发文《17 Reasons Why Gradio Isn't Just Another UI Library》,称 Gradio 不只是 Python UI 库,而是可通过 UI 和 API 与机器学习模型交互的框架。
Cloudflare 与 Hugging Face 达成合作,FastRTC 开发者只需 Hugging Face token 即可使用企业级 WebRTC 基础设施。持有有效 token 的开发者每月可免费传输 10GB 数据,无需信用卡;集成从 FastRTC 0.0.20 起可用,Cloudflare 的 TURN 服务器网络覆盖全球 335 个以上地点。
Hugging Face 团队宣布 Gradio 每月有超过 100 万开发者使用,并复盘五年增长经验。核心做法包括以 Gradio Blocks 等低层原语代替高层抽象(gr.Blocks 占 80% 用量)、用 share links 一行代码实现应用传播、聚焦机器学习 Web 应用这一细分场景、不设路线图只做快速迭代,以及让每个应用同时生成 API 端点以便本地部署或程序化调用。
TNG Technology Consulting 分享自托管 LLM 服务时的请求排队优化经验,指出单个"重度用户"大量请求会通过 vLLM 等推理引擎的 FIFO 队列阻塞其他用户。
Hugging Face 在从 AWS 迁向多云(Azure、GCP)后,选择 Infisical 替代 HashiCorp Vault 集中管理 secrets。
Hugging Face 宣布将 Intel Gaudi 硬件支持直接合入 Text Generation Inference(TGI)主代码库(PR #3091),取代此前维护的独立 fork,基于 TGI 多后端架构支持 Gaudi1/2/3 全系列硬件。
Hugging Face 的 Gradio 更新了 gr.Dataframe 组件,过去 6 周关闭了 70 多个相关 issue。新功能包括多单元格选择、行号与 pinned_columns 列固定、复制与全屏按钮、static_columns 静态列,以及 show_search 参数提供的搜索和过滤功能,还改进了键盘导航等无障碍体验。
Hugging Face 为 Inference Endpoints 更新了分析仪表盘,提供实时指标,可即时查看请求延迟、响应时间和错误率,并重构后端加快高流量端点的数据加载。此外新增自定义时间范围与自动刷新功能,以及 Replica 生命周期视图,可跟踪副本从初始化到终止的每个状态变化。
Hugging Face 已将首批 Model 和 Dataset 仓库从 LFS 迁移到 Xet 存储,共 4.5 TB,约占 Hub 下载流量的 6%。Xet 采用内容定义分块(约 64KB chunk)做字节级去重,只传输改动部分;迁移后团队修复了 CAS 下载开销问题(将 GET 延迟降低约 35%)和 Pod 负载不均衡问题。
Hugging Face 宣布与 JFrog 合作,将 JFrog 的扫描器集成到 Hugging Face Hub,以提升模型安全检测。与仅做模式匹配的 picklescan 不同,JFrog 会解析并分析模型权重中的代码,降低误报,并可检出 pickle 反序列化和 Keras Lambda 层等任意代码执行漏洞。所有公开模型仓库在推送后自动扫描,目前已扫描数亿个文件。
Hugging Face 博客讲解如何用 smolagents 构建一个配备 DuckDuckGoSearchTool 和 VisitWebpageTool 的 CodeAgent,并通过 Arize Phoenix 结合 OpenTelemetry + OpenInference 实现对 Agent 每一步调用的实时追踪与调试。
Hugging Face 发布 FastRTC,一个面向 Python 的实时通信库,用于简化实时音视频 AI 应用开发。库内自动处理语音检测与轮次切换,自带 WebRTC Gradio UI,支持 WebRTC 和 WebSocket,可将 Stream 挂载到任意 FastAPI 应用。
推荐理由:官方发布 Python 实时通信库,内置语音检测、Gradio UI 和免费电话接入,作者还演示了接入 LLM 的完整语音对话代码。
Diffusers 团队推出实验性 Remote VAE 功能,通过 huggingface-inference-toolkit 自定义 handler 将 VAE 解码委托给远程端点,以缓解高分辨率图像和视频生成时消费级 GPU 显存不足、offload 延迟和 tiling 画质损失问题。
Hugging Face Hub 新增 Hyperbolic、Nebius AI Studio 和 Novita 三家 serverless 推理提供商,支持 DeepSeek-R1、FLUX.1 等模型,并集成到 Python 和 JS 客户端 SDK。
Fireworks.ai 现已成为 Hugging Face Hub 支持的推理提供商,可在模型页面及 HF 生态中提供高速 serverless 推理。
这篇 Hugging Face 博客给出每天 10 亿级分类或嵌入推理的成本优化框架,用 Inference Endpoints、Infinity 和 Grafana k6 对三种用例实测。
推荐理由:原文给出可复现的成本与延迟优化框架和实测数字,读者可按自己的任务估算大规模分类和嵌入推理开销。
Hugging Face Xet 团队开源 xet-core 和 hf_xet,将内容定义分块(CDC)引入 Hub,在部分场景将上传下载速度提升 2-3x。
Mistral AI 发布全新 le Chat,定位覆盖生活与工作的 AI 助手,现已上线 iOS、Android 和 chat.mistral.ai。
推荐理由:官方公告列出了 le Chat 的功能变化、移动端入口和三档服务定价,读者可以据此评估它在个人与工作场景中的可用性。
Mistral 发布 Mistral Small 3,一个延迟优化的 24B 参数模型,以 Apache 2.0 许可开源预训练和指令微调权重。模型 MMLU 准确率超 81%,延迟 150 tokens/s,官方称性能与 Llama 3.3 70B instruct 相当且在相同硬件上快 3 倍以上。
推荐理由:24B 参数、Apache 2.0 开源、可在单卡 RTX 4090 本地运行,读者可据此评估低延迟场景下的替代方案。
Hugging Face 与 AWS 合作发布指南,介绍如何用 Hugging Face Inference Endpoints、Amazon Bedrock Marketplace。