Hugging Face:解锁 GPT-OSS 的智能体强化学习训练——一次实践复盘
Hugging Face 团队探索以 GPT-OSS(性能对标 OpenAI o3-mini 和 o4-mini)作为智能体应用骨干模型,用 verl 框架开展智能体强化学习训练。
Hugging Face 团队探索以 GPT-OSS(性能对标 OpenAI o3-mini 和 o4-mini)作为智能体应用骨干模型,用 verl 框架开展智能体强化学习训练。
OpenAI 发布对 Codex agent loop 的技术深度解读,说明 Codex CLI 如何编排模型、工具与提示词。文章介绍了其基于 Responses API 的实现方式与性能考量。
OpenAI 详解了其如何将 PostgreSQL 扩展到每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。技术手段包括使用副本、缓存、速率限制和工作负载隔离。
Mistral AI 团队分享了排查 vLLM 内存泄漏的过程,问题仅出现在 Mistral Medium 3.1 与 P/D 分离部署结合 NIXL、开启 graph compilation 的条件下,系统内存以每分钟 400 MB 的速度线性增长,数小时后触发 out of memory。
Netomi 借助 GPT-4.1 和 GPT-5.2 将企业级 AI 智能体规模化,结合并发处理、治理与多步推理,支撑可靠的生产工作流。
Hugging Face 发布分步教程,教你在 CES 2026 演示基础上用 NVIDIA DGX Spark 和 Reachy Mini 搭建桌面私人助理。
Hugging Face 博客详解 Transformers v5 对分词器的重新设计:将分词器架构(normalizer、pre-tokenizer、算法类型、post-processor、decoder)与训练好的词表和 merges 分离,类似 PyTorch 分离模型结构与权重。
推荐理由:文章来自 transformers 团队,解释 v5 将分词器架构与训练词表分离的设计,便于读者直接检查组件或训练自定义分词器。
NVIDIA 以开放评测方式发布 Nemotron 3 Nano 30B A3B,并公开其完整的评测 recipe。该 recipe 基于 NeMo Evaluator 开源库构建,任何人都可以重跑评测流水线、查看配置与产物并独立验证结果。NeMo Evaluator 将多个评测 harness 统一在同一接口下,评测流程与推理后端解耦,并可生成结构化结果与日志以便审计。
OpenAI 发布面向领导者的文章,讲述如何在 AI 时代构建 AI-ready 组织。文章提出四个关键方向:清晰的战略、员工培训、治理体系,以及加速创新。
OpenAI 仅用 28 天就发布了 Android 版 Sora,全程借助 Codex 完成。团队通过 AI 辅助规划、翻译以及并行编码工作流,以小团队实现了快速、可靠的开发。
llama.cpp server 新增 router mode,无需重启即可动态加载、卸载和切换多个模型,补上类似 Ollama 的模型管理能力。该功能采用多进程架构,单个模型崩溃不影响其他模型;支持自动发现 GGUF 文件、按需加载、LRU 淘汰(默认 --models-max 4)、请求路由和 Web UI 切换。
推荐理由:原文给出 router mode 的加载与切换机制和具体命令选项,读者可以据此评估本地多模型管理的新工作流。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验,覆盖数据验证、硬件选择、提交 Hugging Face Jobs、用 Trackio 监控训练、维护训练报告以及用 lighteval 评测。
推荐理由:官方教程给出让 Codex 端到端跑完微调、评测和 GGUF 导出的完整流程与成本参考,方法可直接迁移到自己的实验。
Virgin Atlantic CFO Oliver Byers 分享了这家航空公司如何使用 AI 加速开发、改善决策并提升客户体验,将 AI 应用于旅行的每一个环节。
Hugging Face 推出 hf-llm-trainer 技能,让 Claude Code、Codex、Gemini CLI 等编码智能体可自动选择 GPU、生成脚本、向 Hugging Face Jobs 提交微调任务并用 Trackio 监控进度,完成后模型自动推送到 Hub。
推荐理由:官方发布了让 Claude Code 等编码智能体端到端微调开源模型的 hf-llm-trainer 技能,覆盖 GPU 选择、任务提交到监控的完整流程。
Hugging Face 官方博客宣布 Diffusers 支持 FLUX.2,提供 Flux2Pipeline 和 Flux2Transformer2DModel 的完整加载与推理示例。
推荐理由:官方博客给出 FLUX.2 在 Diffusers 中的完整推理代码和量化加载方式,读者可以直接照搬运行文生图流程。
Hugging Face 发布教程,从 attention 机制和 KV cache 出发推导 continuous batching,讲解其如何最大化 LLM 服务的吞吐。
Tavily 分享其打造达到 SOTA 水平的 deep research 智能体的经验:七个月前他们放弃了第一版复杂架构并从零重建,因为其中的假设在下一代模型到来时成为瓶颈。
Evals(评测)帮助企业定义、衡量并改进 AI 表现。借助 evals,企业可以降低风险、提升生产力,并获得战略优势。
Hugging Face 的 kernels 库支持构建和分享可在 AMD GPU 上运行的 ROCm kernel,文章以获 AMD Developer Challenge 2025 大奖的 RadeonFlow GEMM kernel 为例,讲解项目结构、build.toml 配置与打包流程。
NVIDIA Isaac for Healthcare v0.4 提供 SO-ARM 入门工作流,帮助开发者构建自主手术助理机器人,覆盖数据采集、训练与部署全流程。
NVIDIA 推出的 Isaac for Healthcare v0.4 提供 SO-ARM 起始工作流,可端到端构建自主手术辅助机器人:用 SO-ARM101 和 LeRobot 采集仿真与真实遥操作数据,post-train GR00T N1.5,在 Isaac Lab 评估后部署到真实硬件。
Hugging Face 在博客中提出 voice consent gate 概念,只有说话人朗读并经 ASR 识别出明确的同意语句后,语音克隆 TTS 才能启动。文中给出包含演示 Space 的示例代码,说明用语言模型按随机日常话题生成同意句与音素多样性句的组合,并指出该设计仍可被其他 TTS 伪造,未来可探索音频溯源等验证手段。
Hugging Face 发布开源 OCR 模型指南,新增 Chandra 和 OlmOCR-2 及其 OlmOCR Benchmark 得分。
推荐理由:指南基于 OlmOCR Benchmark 等公开基准对比了 9 个开源 OCR 模型的格式、大小与成本,并给出按使用场景选型的具体方法。
Intel 与 Hugging Face 在 Google Cloud C4 VM(Intel Xeon 6,代号 Granite Rapids)上对开源 MoE 模型 GPT OSS 进行文本生成基准测试,结果显示相比上一代 C3 VM 实例 TCO 提升 1.7 倍。
Hugging Face 发布教程,介绍用 Optimum Intel 和 OpenVINO 在无 GPU 的 Intel CPU 上本地部署 SmolVLM2-256M-Video-Instruct 的三个步骤:模型转换、量化(权重量化或静态量化)和推理。
Hugging Face 发布三篇系列的第一部分,记录如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换为端侧运行。dots.ocr 由 1.2B 参数 NaViT 架构视觉编码器和 Qwen2.5-1.5B 主干组成,在 OmniDocBench 上超过 Gemini 2.5 Pro。
OpenAI 构建了一套合同数据提取系统,可快速提取合同信息,缩短处理周转时间,让各团队更便捷地获取所需合同细节。
OpenAI 宣布推出新系列 OpenAI on OpenAI,介绍公司如何借助自身技术来精简工作流程、规模化专业能力并推动业务成果。该系列将分享相关实践经验,帮助其他组织实现同样的目标。
OpenAI 构建了内部 AI 销售助手,用于评估入站销售线索、生成个性化回复,帮助销售团队将客户兴趣转化为成交。
作者发布 VibeGame,一个建立在 three.js、rapier 和 bitecs 之上、面向 AI 辅助游戏开发的高层声明式游戏引擎。
推荐理由:作者先实测 Roblox、Unity 和 web 三条 vibe coding 游戏路线,再据此设计出兼顾抽象与开放性的引擎,方法可迁移。
Hugging Face 与 Intel 基于 OpenVINO 在 Intel Core Ultra 集成 GPU 上加速 Qwen3-8B:用 Qwen3-0.6B 作草稿模型的投机解码带来约 1.3× 提速,再从草稿模型 28 层中剪掉 6 层并用 Qwen3-8B 生成的 500k 提示词数据微调后,提速提升至约 1.4×。
Hugging Face 发布 Jupyter Agent 项目,用约 2TB Kaggle 笔记本构建 51k 条合成轨迹、近 0.2B tokens 的数据集,微调 Qwen3-4B-Instruct-2507 与 Qwen3-4B-Thinking-2507。
推荐理由:原文完整给出从数据清洗到微调的管线与消融数字,读者可复用其中提升小模型数据科学能力的做法。
Hugging Face 发文介绍如何在 ZeroGPU Spaces 中用 PyTorch ahead-of-time 编译优化生成式 demo,指出 torch.compile 与 ZeroGPU 短生命周期进程不兼容,需先导出再用 spaces.aoti_* API 编译加载。
推荐理由:原文给出 ZeroGPU 上 AoT 编译的完整步骤和 FP8、动态形状等进阶技巧,读者可以直接迁移到自己的 Spaces demo。
税务研究平台 Blue J 依托专注的领域深耕和合适的 OpenAI 模型,已扩展到三个国家、服务超过 3,000 家企业。公司在税务等高度监管的复杂领域实现快速规模化,验证了领域深度与模型选型相结合的增长路径。
Hugging Face 发布教程,介绍如何把 Claude 连接到 Hugging Face MCP Server,用 Spaces 上的图像生成模型出图。2025 年 10 月更新后需通过 Add custom connector 设置 Remote MCP server URL 为 https://huggingface.co/mcp?
Hugging Face 发布 kernel-builder 使用指南,演示如何从零构建一个 RGB 转灰度的 CUDA kernel,并用 PyTorch C++ API 将其注册为 torch.ops 原生算子。
Hugging Face 发布教程,介绍如何用 Model Context Protocol(MCP)让 AI 通过自然语言调用 arXiv、GitHub、Hugging Face 等研究工具,自动化文献发现的跨平台检索与交叉引用。
Hugging Face 与 Axolotl 在 Accelerate 中集成了 ND-Parallel,可通过 ParallelismConfig 类任意组合 DP。
Hugging Face TRL 宣布为视觉语言模型(VLM)对齐新增 Mixed Preference Optimization(MPO)、多模态 GRPO、GSPO 支持,并扩展 RLOO 和 Online DPO。
Mistral 展示如何通过 LoRA 微调 Pixtral-12B 提升其在卫星图像分类任务上的表现,实验基于 Aerial Image Dataset(AID),采用 8,000 训练样本和 2,000 测试样本的划分。