Mistral AI 发布 Devstral Medium 并升级 Devstral Small 1.1
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两款新模型的 SWE-Bench Verified 分数、许可证与定价,可据此比较成本与代码智能体能力。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出两款新模型的 SWE-Bench Verified 分数、许可证与定价,可据此比较成本与代码智能体能力。
Numina 与 Kimi 团队发布基于 Qwen2.5-72B 和 Kimi k1.5 RL 流水线训练的定理证明模型 Kimina-Prover-72B,并开源 Kimina-Prover-Distill-8B 和 1.7B 蒸馏版。
Hugging Face 发布官方 MCP Server 并撰文复盘其构建过程,通过一个 URL 提供可定制的 Hub 工具接入和数千个 Spaces 应用访问。
推荐理由:官方团队复盘自建 MCP Server 的传输选型与部署权衡,涵盖 Streamable HTTP、无状态配置等可迁移经验。
Hugging Face 发布 Python 库 ScreenEnv,可在 Docker 容器中创建隔离的 Ubuntu 桌面环境,用于测试和部署 GUI 智能体(Computer Use agents)。
推荐理由:原文给出在 Docker 中运行隔离 Ubuntu 桌面环境的用法和 API 与 MCP 两种接入方式,读者可直接复用搭建 GUI 智能体。
Hugging Face 与 Pollen Robotics 发布开源桌面机器人 Reachy Mini,面向人机交互、创意编程与 AI 实验,提供 $399 的 Lite 版和 $499 的无线自主版(含树莓派 4 与电池)。
Hugging Face 与 AMD 合作,为在 8 张 MI300X 节点上用 VLLM 以 FP8 部署 Llama 3.1 405B 优化 kernel,包含融合残差连接、RMS norm 与 FP8 转换、融合 SwiGLU 与 FP8 转换、skinny GEMM 三个优化 kernel,显著降低解码延迟。
Hugging Face 团队在 nanoVLM 项目中发现训练慢的根源是数据管线浪费,朴素 padding 约浪费 60% 的 batch。文章分五阶段构建高效管线,用背包问题的 greedy 与 bin-packing 策略打包样本,兼顾 token 长度和图像预算,显著减少 padding。
Hugging Face 发布完全开源的 SmolLM3-3B,用 11.2T tokens 分三阶段预训练,性能超越 Llama-3.2-3B 和 Qwen2.5-3B,并与 Qwen3-4B、Gemma3-4B 等更大模型竞争力相当。
推荐理由:官方同步放出模型、三阶段预训练配比和双模式推理完整训练配方,适合想复现或改进同级小模型的研究者对照学习。
Hugging Face 发布长文教程,讲解如何用 Sentence Transformers 训练和微调稀疏嵌入模型,并演示得到 sparse-encoder/example-inference-free-splade-distilbert-base-uncased-nq。
Google Gemma 3n 正式开源,发布 E2B 和 E4B 两个尺寸、各含 base 与 instruct 版本,支持图像、文本、音频和视频输入。E2B/E4B 实际参数为 5B/8B,但借助 MatFormer 架构与 Per-Layer Embeddings,仅需 2GB/3GB GPU 内存即可运行,E4B 还在 LMArena 上取得 1300+ 分数。
推荐理由:原文给出模型的有效参数设计、显存需求和各开源库用法,端侧开发者可以据此选择部署方式。
Hugging Face 发布教程,展示用 QLoRA 配合 diffusers 在单张 GPU 上以约 9GB 峰值显存微调 FLUX.1-dev 学习 Alphonse Mucha 画风,700 步在 RTX 4090 上约 41 分钟完成,标准 BF16 LoRA 则需 26GB。
推荐理由:官方博客给出完整的 QLoRA 微调配方和实测显存与耗时数据,方法可直接迁移到消费级显卡上的 FLUX.1-dev 定制训练。
Featherless AI 成为 Hugging Face Hub 支持的 Inference Provider,用户可在模型页面直接使用其 serverless 推理服务。
NVIDIA 发布 Isaac GR00T N1.5——首个开源通用人形机器人基础模型 GR00T N1 的首次重大更新,并提供用 LeRobot SO-101 机械臂遥操作数据进行微调的完整教程。
Hugging Face 与 NVIDIA 在 GTC Paris 上宣布推出 Training Cluster as a Service,让全球研究机构可按需申请 GPU 集群并只为训练运行时长付费。
Mistral AI 发布首个推理模型 Magistral,含 24B 开源的 Magistral Small(Apache 2.0)和企业版 Magistral Medium。
推荐理由:原文给出两版本的具体评测分数、开源许可和部署渠道,读者可据此评估其在推理模型中的定位与可用性。
Hugging Face 发布 ScreenSuite,一套覆盖感知、定位、单步操作和多步智能体四类能力的 GUI Agent 评测套件,整合 13 个基准,如 ScreenQA-Short、ScreenSpot-Pro、AndroidWorld 和 OSWorld。
Hugging Face 在 nanoVLM 仓库中从零实现 KV Caching,生成速度提升 38%。文章讲解自回归生成中重复计算 K/V 的冗余来源,展示通过逐层缓存字典、start_pos 位置对齐以及将 generate 循环拆分为 prefill 和 decode 两阶段来消除冗余计算,并指出这是速度与显存之间的权衡。
Arm 生态负责人 Michael Gamble 构建了一个在 Arm CPU 上本地运行的音频生成应用,无需 GPU 或云端推理。该应用基于 Stability AI 的 Stable Audio Open 模型(经 Hugging Face 获取),用 PyTorch 和 TorchAudio 执行推理,通过减少扩散步数(steps=7)和全线程利用实现数秒内生成。
H Company 发布开源 Action VLM 系列 Holo1(含 Holo1-3B 与 Holo1-7B),并同步开源含 1,639 项 UI 任务的 WebClick 多模态定位基准。
推荐理由:官方给出模型规格、定位准确率和每任务成本数字,读者可据此评估这套开源 GUI 自动化方案的实际性价比。
Hugging Face 在 TRL v0.18.0 通过 PR #3394 引入 vllm_mode="colocate",让 vLLM 不再以独立 HTTP 服务器运行,而是嵌入同一分布式进程组,与 GRPO 训练共享同一批 GPU,消除训练与生成之间的互相等待。
Hugging Face 发布 450M 参数的开源视觉-语言-动作模型 SmolVLA,基于 lerobot 标签下的社区共享数据集预训练,可在消费级硬件(甚至 CPU 或 MacBook)上运行和训练。
TRL 的 GRPOTrainer 通过 compute_liger_loss 接入 liger_kernel 的 GRPO loss。
Hugging Face 与 Dell 在 Dell Tech World 上发布新版 Dell Enterprise Hub,提供模型与应用套件,可在 Dell AI 服务器和 AI PC 上本地部署 AI。
Mistral AI 与 All Hands AI 联合发布面向软件工程任务的智能体模型 Devstral,以 Apache 2.0 许可开源,在 SWE-Bench Verified 上取得 46.8%,超过此前开源 SoTA 6 个百分点以上,并超越 GPT-4.1-mini 超过 20%。
推荐理由:原文给出 SWE-Bench Verified 具体分数和部署门槛,可判断这款开源编码模型在本地与隐私场景的可行性。
TII 发布 Falcon-H1 系列开源模型,包含 0.5B、1.5B、1.5B-Deep、3B、7B、34B 六种规模及对应 instruct 版本,采用注意力与 Mamba-2 并行的混合架构,基于 Apache 2.0 类宽松许可。
Hugging Face 联合 TII 推出 Falcon-Arabic,一个基于 Falcon 3 架构的 7B 参数多语言大模型,支持阿拉伯语和英语。模型通过扩展 32,000 个阿拉伯语 token 进行持续预训练,上下文长度为 32,000 tokens。
Hugging Face 发布 nanoVLM,一个纯 PyTorch 的轻量工具包,可在免费 Colab 上启动视觉语言模型训练,灵感来自 Andrej Karpathy 的 nanoGPT。
推荐理由:原文拆解了 nanoVLM 的架构、训练与推理全流程,代码轻量可读,适合想从头理解 VLM 训练机制的读者上手实践。
Microsoft 与 Hugging Face 在 Microsoft Build 上宣布扩大合作,Azure AI Foundry 现提供 10,000+ Hugging Face 开放模型,可数次点击部署以支持文本、音频和图像 AI 应用。
TII 发布基于 BitNet 架构的 Falcon-Edge 系列三值语言模型,提供 1B 和 3B 两种参数规模,各含 base 和 instruct 版本。
Hugging Face 宣布 Transformers 将成为跨框架的模型定义标准,现支持 300+ 架构,平均每周新增约 3 个,并为 Llama、Qwen、GLM 等热门架构提供 day-0 支持。
推荐理由:Hugging Face 官方说明 Transformers 转型为跨框架模型定义标准,读者可以据此判断训练与推理工具链如何围绕它互通。
Hugging Face 与 Kaggle 推出平台整合,提升 Hugging Face 模型在 Kaggle 上的可见性与可发现性。
Hugging Face LeRobot 团队认为机器人泛化本质上是一个数据问题,正通过简化录制流程、简化上传至 Hugging Face Hub、降低硬件成本,让社区数据集快速增长。目前社区贡献主要集中在 So100 和 Koch 机械臂与操作任务,但自动驾驶、辅助机器人、移动导航等领域同样受益。随着数据采集大众化,数据策展成为下一个挑战。
Hugging Face 博客对比 Qwen-3 与 Qwen-2.5、QwQ 的 Jinja chat template,总结出四点设计差异:Qwen-3 通过 enable_thinking 标志配合空 <think></think> 让推理变为可选项,而 QwQ 强制每次推理。
Hugging Face 官方博客介绍如何用 Gradio 将 Python 函数构建为 MCP 服务器,只需安装 gradio[mcp] 并在 .launch() 中设置 mcp_server=True,即可让 LLM 通过 Claude Desktop、Cursor、Cline 等 MCP Client 调用该应用作为工具。
推荐理由:官方教程演示只需在 launch 中设 mcp_server=True 即可把任意 Gradio 应用变成 MCP server,含资源和鉴权等进阶用法。
Hugging Face 发布 Tiny Agents 教程,展示在 InferenceClient 之上实现 MCP 客户端后,Agent 本质上只是一个 while 循环,全部代码约 50 行 TypeScript。
推荐理由:作者把 MCP 客户端到 Agent 的实现压缩成约 50 行 TypeScript,并提供可运行的开源代码,适合想理解 Agent 与 MCP 基本结构的开发者直接上手。
TNG 基于 olmOCR-7B-0225-preview 微调出一款忠实 OCR 引擎,解决原模型忽略页眉页脚信息的问题,已开源到 HuggingFace。团队用 Qwen2.5-VL-72B-Instruct 生成了 8000 份文档的数据集,在 8xH100 节点上训练 2.5 epochs,默认超参数即可取得良好效果。
Hugging Face 官方博客发文《17 Reasons Why Gradio Isn't Just Another UI Library》,称 Gradio 不只是 Python UI 库,而是可通过 UI 和 API 与机器学习模型交互的框架。
Cohere 正式成为 Hugging Face Hub 支持的 Inference Provider,也是首个在 Hub 上直接分享并提供模型推理的模型创建方。
Hugging Face 宣布收购开源机器人公司 Pollen Robotics,这是其第五次收购,将开售旗舰人形机器人 Reachy 2,售价 $70,000,已用于 Cornell 和 Carnegie Mellon 等实验室。
推荐理由:官方宣布收购开源机器人公司并开放 Reachy 2 订购,读者可据此了解 Hugging Face 从软件平台走向机器人硬件的路线。
Protect AI 与 Hugging Face 自 2024 年 10 月合作以来,截至 2025 年 4 月 1 日已扫描 Hub 上 141 万个仓库中的 447 万个模型版本,累计在 51,700 个模型中发现 352,000 个不安全或可疑问题。