Hugging Face Skills 教程:让 Codex 端到端完成模型微调实验
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验,覆盖数据验证、硬件选择、提交 Hugging Face Jobs、用 Trackio 监控训练、维护训练报告以及用 lighteval 评测。
推荐理由:官方教程给出让 Codex 端到端跑完微调、评测和 GGUF 导出的完整流程与成本参考,方法可直接迁移到自己的实验。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验,覆盖数据验证、硬件选择、提交 Hugging Face Jobs、用 Trackio 监控训练、维护训练报告以及用 lighteval 评测。
推荐理由:官方教程给出让 Codex 端到端跑完微调、评测和 GGUF 导出的完整流程与成本参考,方法可直接迁移到自己的实验。
Virgin Atlantic CFO Oliver Byers 分享了这家航空公司如何使用 AI 加速开发、改善决策并提升客户体验,将 AI 应用于旅行的每一个环节。
Hugging Face 推出 hf-llm-trainer 技能,让 Claude Code、Codex、Gemini CLI 等编码智能体可自动选择 GPU、生成脚本、向 Hugging Face Jobs 提交微调任务并用 Trackio 监控进度,完成后模型自动推送到 Hub。
推荐理由:官方发布了让 Claude Code 等编码智能体端到端微调开源模型的 hf-llm-trainer 技能,覆盖 GPU 选择、任务提交到监控的完整流程。
Hugging Face 发布教程,从 attention 机制和 KV cache 出发推导 continuous batching,讲解其如何最大化 LLM 服务的吞吐。
Tavily 分享其打造达到 SOTA 水平的 deep research 智能体的经验:七个月前他们放弃了第一版复杂架构并从零重建,因为其中的假设在下一代模型到来时成为瓶颈。
Evals(评测)帮助企业定义、衡量并改进 AI 表现。借助 evals,企业可以降低风险、提升生产力,并获得战略优势。
Hugging Face 的 kernels 库支持构建和分享可在 AMD GPU 上运行的 ROCm kernel,文章以获 AMD Developer Challenge 2025 大奖的 RadeonFlow GEMM kernel 为例,讲解项目结构、build.toml 配置与打包流程。
NVIDIA Isaac for Healthcare v0.4 提供 SO-ARM 入门工作流,帮助开发者构建自主手术助理机器人,覆盖数据采集、训练与部署全流程。
NVIDIA 推出的 Isaac for Healthcare v0.4 提供 SO-ARM 起始工作流,可端到端构建自主手术辅助机器人:用 SO-ARM101 和 LeRobot 采集仿真与真实遥操作数据,post-train GR00T N1.5,在 Isaac Lab 评估后部署到真实硬件。
Hugging Face 在博客中提出 voice consent gate 概念,只有说话人朗读并经 ASR 识别出明确的同意语句后,语音克隆 TTS 才能启动。文中给出包含演示 Space 的示例代码,说明用语言模型按随机日常话题生成同意句与音素多样性句的组合,并指出该设计仍可被其他 TTS 伪造,未来可探索音频溯源等验证手段。
Hugging Face 发布开源 OCR 模型指南,新增 Chandra 和 OlmOCR-2 及其 OlmOCR Benchmark 得分。
推荐理由:指南基于 OlmOCR Benchmark 等公开基准对比了 9 个开源 OCR 模型的格式、大小与成本,并给出按使用场景选型的具体方法。
Intel 与 Hugging Face 在 Google Cloud C4 VM(Intel Xeon 6,代号 Granite Rapids)上对开源 MoE 模型 GPT OSS 进行文本生成基准测试,结果显示相比上一代 C3 VM 实例 TCO 提升 1.7 倍。
Hugging Face 发布教程,介绍用 Optimum Intel 和 OpenVINO 在无 GPU 的 Intel CPU 上本地部署 SmolVLM2-256M-Video-Instruct 的三个步骤:模型转换、量化(权重量化或静态量化)和推理。
Hugging Face 发布三篇系列的第一部分,记录如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换为端侧运行。dots.ocr 由 1.2B 参数 NaViT 架构视觉编码器和 Qwen2.5-1.5B 主干组成,在 OmniDocBench 上超过 Gemini 2.5 Pro。
OpenAI 构建了一套合同数据提取系统,可快速提取合同信息,缩短处理周转时间,让各团队更便捷地获取所需合同细节。
OpenAI 宣布推出新系列 OpenAI on OpenAI,介绍公司如何借助自身技术来精简工作流程、规模化专业能力并推动业务成果。该系列将分享相关实践经验,帮助其他组织实现同样的目标。
OpenAI 构建了内部 AI 销售助手,用于评估入站销售线索、生成个性化回复,帮助销售团队将客户兴趣转化为成交。
Hugging Face 与 Intel 基于 OpenVINO 在 Intel Core Ultra 集成 GPU 上加速 Qwen3-8B:用 Qwen3-0.6B 作草稿模型的投机解码带来约 1.3× 提速,再从草稿模型 28 层中剪掉 6 层并用 Qwen3-8B 生成的 500k 提示词数据微调后,提速提升至约 1.4×。
Hugging Face 发布 Smol2Operator 方案,将无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 通过两阶段 SFT 训练为 GUI 智能体,在 ScreenSpot-v2 上从基线 0 提升到 61.71%。
Hugging Face 发文介绍为支持 OpenAI GPT-OSS 对 transformers 库的多项升级,包括从 Hub 下载预编译内核、原生 MXFP4 量化、张量并行与专家并行、动态滑动窗口 KV 缓存、Continuous Batching 和更快的模型加载。
推荐理由:Hugging Face 官方详解为支持 gpt-oss 对 transformers 做的各项升级,多数特性可复用到其他模型。
Hugging Face 发文介绍如何在 ZeroGPU Spaces 中用 PyTorch ahead-of-time 编译优化生成式 demo,指出 torch.compile 与 ZeroGPU 短生命周期进程不兼容,需先导出再用 spaces.aoti_* API 编译加载。
推荐理由:原文给出 ZeroGPU 上 AoT 编译的完整步骤和 FP8、动态形状等进阶技巧,读者可以直接迁移到自己的 Spaces demo。
税务研究平台 Blue J 依托专注的领域深耕和合适的 OpenAI 模型,已扩展到三个国家、服务超过 3,000 家企业。公司在税务等高度监管的复杂领域实现快速规模化,验证了领域深度与模型选型相结合的增长路径。
Hugging Face 发布教程,介绍如何把 Claude 连接到 Hugging Face MCP Server,用 Spaces 上的图像生成模型出图。2025 年 10 月更新后需通过 Add custom connector 设置 Remote MCP server URL 为 https://huggingface.co/mcp?
Hugging Face 发布 kernel-builder 使用指南,演示如何从零构建一个 RGB 转灰度的 CUDA kernel,并用 PyTorch C++ API 将其注册为 torch.ops 原生算子。
Hugging Face 发布教程,介绍如何用 Model Context Protocol(MCP)让 AI 通过自然语言调用 arXiv、GitHub、Hugging Face 等研究工具,自动化文献发现的跨平台检索与交叉引用。
Hugging Face 与 Axolotl 在 Accelerate 中集成了 ND-Parallel,可通过 ParallelismConfig 类任意组合 DP。
Mistral 展示如何通过 LoRA 微调 Pixtral-12B 提升其在卫星图像分类任务上的表现,实验基于 Aerial Image Dataset(AID),采用 8,000 训练样本和 2,000 测试样本的划分。
Hugging Face 发布教程,展示如何用 Gradio 的 MCP 集成在 Python 中搭建 AI 购物助手,让 LLM 联合 IDM-VTON Diffusion 模型实现虚拟试穿。教程将 Python 函数自动转换为 MCP 工具,并用 VS Code 的 AI 聊天配合 Playwright 浏览器工具,实现浏览服装网站并生成试穿效果。
OpenAI 分享 Intercom 构建可扩展 AI 平台的三大经验,涵盖评估到架构的实践方法。这些经验帮助 Intercom 在客户支持领域保持领先。
Hugging Face 宣布 Parquet 内容定义分块(CDC)已在 PyArrow 和 Pandas 中可用,通过 use_content_defined_chunking=True 参数启用,可与其 Xet 存储层配合仅传输变化的数据块。
推荐理由:官方用七类数据变更场景实测 Parquet CDC 与 Xet 的去重效果,读者可据此评估迁移到 CDC 写入对上传下载的实际收益。
Outtake 使用 GPT-4.1 和 OpenAI o3 驱动 AI 智能体,检测和处置数字威胁的速度比此前提升 100 倍。OpenAI News 介绍了这家公司如何将两套模型用于威胁响应。该案例展示了前沿模型在网络安全自动化场景中的实际落地。
Hugging Face 发布教程,介绍结合 Flash Attention 3、torch.compile 和 FP8 量化的 Flux.1-Dev LoRA 推理优化配方,在 H100 上相对基线取得 2.23x 加速,并支持 LoRA 热切换而不触发重编译。
推荐理由:原文给出可直接复用的 LoRA 推理优化配方和 H100、RTX 4090 两套实测延迟数据,并说明热切换避免重编译的限制。
Arc Institute 推出 Virtual Cell Challenge,参赛者需训练模型预测 CRISPR 沉默基因在部分未见细胞类型中的效果,即"上下文泛化"任务。
开发者在 Gradio Agents & MCP Hackathon 期间构建了多 LLM 协作平台 Consilium,让多个模型通过结构化辩论达成共识,并支持多数投票、排序选择等决策模式。
Hugging Face 发布官方 MCP Server 并撰文复盘其构建过程,通过一个 URL 提供可定制的 Hub 工具接入和数千个 Spaces 应用访问。
推荐理由:官方团队复盘自建 MCP Server 的传输选型与部署权衡,涵盖 Streamable HTTP、无状态配置等可迁移经验。
Hugging Face 提出机器人异步推理方案,将动作预测与执行解耦:PolicyServer 负责推理,RobotClient 维护动作队列并执行,两者通过 gRPC 通信,比同类 REST API 快约 5 倍。该方案已在 SmolVLA 中引入,任务完成时间提速约 2 倍,成功率相当,使机器人不再等待推理,支持中途重规划和更快的控制循环。
Hugging Face 发布教程,讲解如何通过 MCP 协议给 LLM 添加图像编辑、转写等新能力。Gradio 自 5.28.0 版本起支持 MCP 协议,使 Hugging Face Spaces 成为可按 MCP Compatible 筛选的 MCP 服务器集合。
推荐理由:官方教程给出把 Hugging Face Spaces 当作 MCP 工具来源的具体步骤,读者可照做给自己的 LLM 添加图像编辑等新能力。
Hugging Face 与 AMD 合作,为在 8 张 MI300X 节点上用 VLLM 以 FP8 部署 Llama 3.1 405B 优化 kernel,包含融合残差连接、RMS norm 与 FP8 转换、融合 SwiGLU 与 FP8 转换、skinny GEMM 三个优化 kernel,显著降低解码延迟。
Hugging Face 基础设施团队分享支撑其生产基础设施的三个关键监控告警:NAT Gateway 高吞吐量告警用于发现异常流量峰值并优化成本(如通过 DNS 覆盖让对象存储访问走私有低成本路径),以及 Hub 请求日志归档成功率告警。
Hugging Face 团队在 nanoVLM 项目中发现训练慢的根源是数据管线浪费,朴素 padding 约浪费 60% 的 batch。文章分五阶段构建高效管线,用背包问题的 greedy 与 bin-packing 策略打包样本,兼顾 token 长度和图像预算,显著减少 padding。