Photorium PRX 系列第二篇:用消融实验讲透文本生成图像模型的训练设计
Photorium 发布 PRX 文生图训练系列第二篇,在统一的 Flow Matching 基线上系统消融各类训练技巧。
Photorium 发布 PRX 文生图训练系列第二篇,在统一的 Flow Matching 基线上系统消融各类训练技巧。
Hugging Face 发布 upskill 工具,用 Claude Opus 4.5 生成和评估 agent 技能,再供更小、更便宜或本地模型使用。流程为用 Claude Code 完成任务并导出 trace、从 trace 生成 SKILL.md 技能文件并自动生成测试用例,然后用 upskill eval 对比模型有无技能的表现。
推荐理由:原文给出了用大模型生成技能再迁移到小模型的完整流程和实测数字,方法可直接复用于领域任务。
Hugging Face 团队探索以 GPT-OSS(性能对标 OpenAI o3-mini 和 o4-mini)作为智能体应用骨干模型,用 verl 框架开展智能体强化学习训练。
OpenAI 发布对 Codex agent loop 的技术深度解读,说明 Codex CLI 如何编排模型、工具与提示词。文章介绍了其基于 Responses API 的实现方式与性能考量。
OpenAI 详解了其如何将 PostgreSQL 扩展到每秒数百万次查询,以支撑 8 亿 ChatGPT 用户。技术手段包括使用副本、缓存、速率限制和工作负载隔离。
Mistral AI 团队分享了排查 vLLM 内存泄漏的过程,问题仅出现在 Mistral Medium 3.1 与 P/D 分离部署结合 NIXL、开启 graph compilation 的条件下,系统内存以每分钟 400 MB 的速度线性增长,数小时后触发 out of memory。
Netomi 借助 GPT-4.1 和 GPT-5.2 将企业级 AI 智能体规模化,结合并发处理、治理与多步推理,支撑可靠的生产工作流。
Hugging Face 发布分步教程,教你在 CES 2026 演示基础上用 NVIDIA DGX Spark 和 Reachy Mini 搭建桌面私人助理。
Hugging Face 博客详解 Transformers v5 对分词器的重新设计:将分词器架构(normalizer、pre-tokenizer、算法类型、post-processor、decoder)与训练好的词表和 merges 分离,类似 PyTorch 分离模型结构与权重。
推荐理由:文章来自 transformers 团队,解释 v5 将分词器架构与训练词表分离的设计,便于读者直接检查组件或训练自定义分词器。
NVIDIA 以开放评测方式发布 Nemotron 3 Nano 30B A3B,并公开其完整的评测 recipe。该 recipe 基于 NeMo Evaluator 开源库构建,任何人都可以重跑评测流水线、查看配置与产物并独立验证结果。NeMo Evaluator 将多个评测 harness 统一在同一接口下,评测流程与推理后端解耦,并可生成结构化结果与日志以便审计。
OpenAI 发布面向领导者的文章,讲述如何在 AI 时代构建 AI-ready 组织。文章提出四个关键方向:清晰的战略、员工培训、治理体系,以及加速创新。
OpenAI 仅用 28 天就发布了 Android 版 Sora,全程借助 Codex 完成。团队通过 AI 辅助规划、翻译以及并行编码工作流,以小团队实现了快速、可靠的开发。
Hugging Face 发布教程,展示如何用 Hugging Face Skills 让 OpenAI Codex 端到端完成机器学习实验,覆盖数据验证、硬件选择、提交 Hugging Face Jobs、用 Trackio 监控训练、维护训练报告以及用 lighteval 评测。
推荐理由:官方教程给出让 Codex 端到端跑完微调、评测和 GGUF 导出的完整流程与成本参考,方法可直接迁移到自己的实验。
Virgin Atlantic CFO Oliver Byers 分享了这家航空公司如何使用 AI 加速开发、改善决策并提升客户体验,将 AI 应用于旅行的每一个环节。
Hugging Face 推出 hf-llm-trainer 技能,让 Claude Code、Codex、Gemini CLI 等编码智能体可自动选择 GPU、生成脚本、向 Hugging Face Jobs 提交微调任务并用 Trackio 监控进度,完成后模型自动推送到 Hub。
推荐理由:官方发布了让 Claude Code 等编码智能体端到端微调开源模型的 hf-llm-trainer 技能,覆盖 GPU 选择、任务提交到监控的完整流程。
Hugging Face 发布教程,从 attention 机制和 KV cache 出发推导 continuous batching,讲解其如何最大化 LLM 服务的吞吐。
Tavily 分享其打造达到 SOTA 水平的 deep research 智能体的经验:七个月前他们放弃了第一版复杂架构并从零重建,因为其中的假设在下一代模型到来时成为瓶颈。
Evals(评测)帮助企业定义、衡量并改进 AI 表现。借助 evals,企业可以降低风险、提升生产力,并获得战略优势。
Hugging Face 的 kernels 库支持构建和分享可在 AMD GPU 上运行的 ROCm kernel,文章以获 AMD Developer Challenge 2025 大奖的 RadeonFlow GEMM kernel 为例,讲解项目结构、build.toml 配置与打包流程。
NVIDIA Isaac for Healthcare v0.4 提供 SO-ARM 入门工作流,帮助开发者构建自主手术助理机器人,覆盖数据采集、训练与部署全流程。
NVIDIA 推出的 Isaac for Healthcare v0.4 提供 SO-ARM 起始工作流,可端到端构建自主手术辅助机器人:用 SO-ARM101 和 LeRobot 采集仿真与真实遥操作数据,post-train GR00T N1.5,在 Isaac Lab 评估后部署到真实硬件。
Hugging Face 在博客中提出 voice consent gate 概念,只有说话人朗读并经 ASR 识别出明确的同意语句后,语音克隆 TTS 才能启动。文中给出包含演示 Space 的示例代码,说明用语言模型按随机日常话题生成同意句与音素多样性句的组合,并指出该设计仍可被其他 TTS 伪造,未来可探索音频溯源等验证手段。
Hugging Face 发布开源 OCR 模型指南,新增 Chandra 和 OlmOCR-2 及其 OlmOCR Benchmark 得分。
推荐理由:指南基于 OlmOCR Benchmark 等公开基准对比了 9 个开源 OCR 模型的格式、大小与成本,并给出按使用场景选型的具体方法。
Intel 与 Hugging Face 在 Google Cloud C4 VM(Intel Xeon 6,代号 Granite Rapids)上对开源 MoE 模型 GPT OSS 进行文本生成基准测试,结果显示相比上一代 C3 VM 实例 TCO 提升 1.7 倍。
Hugging Face 发布三篇系列的第一部分,记录如何将 RedNote 的 3B 参数 OCR 模型 dots.ocr 转换为端侧运行。dots.ocr 由 1.2B 参数 NaViT 架构视觉编码器和 Qwen2.5-1.5B 主干组成,在 OmniDocBench 上超过 Gemini 2.5 Pro。
OpenAI 宣布推出新系列 OpenAI on OpenAI,介绍公司如何借助自身技术来精简工作流程、规模化专业能力并推动业务成果。该系列将分享相关实践经验,帮助其他组织实现同样的目标。
Hugging Face 与 Intel 基于 OpenVINO 在 Intel Core Ultra 集成 GPU 上加速 Qwen3-8B:用 Qwen3-0.6B 作草稿模型的投机解码带来约 1.3× 提速,再从草稿模型 28 层中剪掉 6 层并用 Qwen3-8B 生成的 500k 提示词数据微调后,提速提升至约 1.4×。
Hugging Face 发布 Smol2Operator 方案,将无 GUI 定位能力的 SmolVLM2-2.2B-Instruct 通过两阶段 SFT 训练为 GUI 智能体,在 ScreenSpot-v2 上从基线 0 提升到 61.71%。
Hugging Face 发文介绍为支持 OpenAI GPT-OSS 对 transformers 库的多项升级,包括从 Hub 下载预编译内核、原生 MXFP4 量化、张量并行与专家并行、动态滑动窗口 KV 缓存、Continuous Batching 和更快的模型加载。
推荐理由:Hugging Face 官方详解为支持 gpt-oss 对 transformers 做的各项升级,多数特性可复用到其他模型。
Hugging Face 发文介绍如何在 ZeroGPU Spaces 中用 PyTorch ahead-of-time 编译优化生成式 demo,指出 torch.compile 与 ZeroGPU 短生命周期进程不兼容,需先导出再用 spaces.aoti_* API 编译加载。
推荐理由:原文给出 ZeroGPU 上 AoT 编译的完整步骤和 FP8、动态形状等进阶技巧,读者可以直接迁移到自己的 Spaces demo。
税务研究平台 Blue J 依托专注的领域深耕和合适的 OpenAI 模型,已扩展到三个国家、服务超过 3,000 家企业。公司在税务等高度监管的复杂领域实现快速规模化,验证了领域深度与模型选型相结合的增长路径。
Hugging Face 发布教程,介绍如何把 Claude 连接到 Hugging Face MCP Server,用 Spaces 上的图像生成模型出图。2025 年 10 月更新后需通过 Add custom connector 设置 Remote MCP server URL 为 https://huggingface.co/mcp?
Hugging Face 发布 kernel-builder 使用指南,演示如何从零构建一个 RGB 转灰度的 CUDA kernel,并用 PyTorch C++ API 将其注册为 torch.ops 原生算子。
Hugging Face 发布教程,介绍如何用 Model Context Protocol(MCP)让 AI 通过自然语言调用 arXiv、GitHub、Hugging Face 等研究工具,自动化文献发现的跨平台检索与交叉引用。
Hugging Face 与 Axolotl 在 Accelerate 中集成了 ND-Parallel,可通过 ParallelismConfig 类任意组合 DP。
Mistral 展示如何通过 LoRA 微调 Pixtral-12B 提升其在卫星图像分类任务上的表现,实验基于 Aerial Image Dataset(AID),采用 8,000 训练样本和 2,000 测试样本的划分。
Hugging Face 发布教程,展示如何用 Gradio 的 MCP 集成在 Python 中搭建 AI 购物助手,让 LLM 联合 IDM-VTON Diffusion 模型实现虚拟试穿。教程将 Python 函数自动转换为 MCP 工具,并用 VS Code 的 AI 聊天配合 Playwright 浏览器工具,实现浏览服装网站并生成试穿效果。
OpenAI 分享 Intercom 构建可扩展 AI 平台的三大经验,涵盖评估到架构的实践方法。这些经验帮助 Intercom 在客户支持领域保持领先。
Hugging Face 宣布 Parquet 内容定义分块(CDC)已在 PyArrow 和 Pandas 中可用,通过 use_content_defined_chunking=True 参数启用,可与其 Xet 存储层配合仅传输变化的数据块。
推荐理由:官方用七类数据变更场景实测 Parquet CDC 与 Xet 的去重效果,读者可据此评估迁移到 CDC 写入对上传下载的实际收益。
Outtake 使用 GPT-4.1 和 OpenAI o3 驱动 AI 智能体,检测和处置数字威胁的速度比此前提升 100 倍。OpenAI News 介绍了这家公司如何将两套模型用于威胁响应。该案例展示了前沿模型在网络安全自动化场景中的实际落地。