Microsoft Research 开源 Orchard 智能体研究框架
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:开源框架把环境层做成可复用服务,并支持直接在真实部署 harness 中训练,为低成本研究智能体提供了可复用的路径。
Microsoft Research 发布开源框架 Orchard,核心是可复用的 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理智能体的训练与评估,并可直接在 Codex、OpenClaw、ZeroClaw 等真实部署 harness 中训练。
推荐理由:开源框架把环境层做成可复用服务,并支持直接在真实部署 harness 中训练,为低成本研究智能体提供了可复用的路径。
Hugging Face 宣布 Diffusers 原生支持 Nunchaku 的 SVDQuant 4-bit 推理,通过 Nunchaku Lite 集成路径直接用 from_pretrained() 加载量化 checkpoint,无需独立推理引擎或本地 CUDA 编译。
推荐理由:Diffusers 原生集成 Nunchaku,W4A4 量化在降显存的同时也降低推理延迟,是可复现的部署方案变化。
Pollen Robotics 发布开源低成本系统 Grabette,用手持夹爪录制操作任务并自动转成机器人可用的 LeRobot 数据集,无需机器人或遥操作设备。
英国 AISI 分析显示,开源权重模型与闭源前沿模型的网络安全能力差距在缩小:GLM-5.2 和 DeepSeek-V4-Pro 已接近比其早发布 4 至 7 个月的闭源前沿模型,而 2025 年大部分时间这一差距为 6 至 10 个月。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,总参数 975B、激活 41B 的 MoE 架构,原生接受图像、文本和音频输入,支持 1M 上下文窗口,训练数据为 45 万亿 token。
推荐理由:原文给出架构细节、各档位 VRAM 部署配置和多模态评测数据,对评估落地成本和选择变体有直接参考。
Microsoft 在 Build 2026 上推出 Foundry Managed Compute,并在 Foundry 模型目录中上线 Hugging Face 精选模型集,数以千计的开源权重模型每周更新,可一键部署到 NVIDIA A100、H100 或 AMD MI300X 加速器。
推荐理由:原文来自双方官方博客,详细说明了精选目录、curation 流程、运行时选择和部署模板,读者可以据此评估在 Foundry 上部署开源模型的实际路径。
LeRobot v0.6.0 发布,引入 VLA-JEPA、FastWAM、LingBot-VA 三种会预测未来的世界模型策略,新增 GR00T N1.7、MolmoAct2、EO-1 等多个 VLA,以及统一奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布页完整列出各项新能力与配套工具,读者可以据此评估这次版本更新对机器人学习工作流的实际影响。
SkyPilot 与 Hugging Face 联合推出 store: hf,用一条 hf:// URL 即可将 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,作业可调度到 20+ 云、Kubernetes 和本地集群。
推荐理由:原文给出 hf:// 挂载、零 egress 读费与 Xet 去重的具体数字,读者可据此评估多云 GPU 任务的数据存储方案。
Photoroom 发布 PRX 系列第四篇博客,详解其 7B 文生图模型的预训练数据策略,包括用 Lance 建库、Mosaic Streaming(MDS)供流、分辨率与长宽比分桶等核心环节。
Hugging Face 官方博客总结 🤗 Kernels 项目近几个月的重大更新。Hub 新增 kernel 仓库类型,可查看内核支持的加速器、操作系统和后端版本;默认只加载受信任发布者的内核,非受信来源需显式传 trust_remote_code=True,并引入基于 Sigstore cosign 的代码签名(加载时尚未默认验证)。
Hugging Face 与 Cerebras 发布开源级联语音到语音管线,语音识别用 Nvidia Parakeet,语言模型为 Google DeepMind Gemma 4 31B 并在 Cerebras 上推理,语音合成用 Qwen3TTS。
Google Research 发布面向表格数据分类与回归的零样本基础模型 TabFM,将表格预测重构为上下文学习问题,免去人工训练、调参和特征工程。
推荐理由:官方介绍了把表格预测重构为上下文学习问题的模型设计、合成数据训练方式和 TabArena 基准结果,读者可据此评估其对传统表格机器学习流程的影响。
Hugging Face 宣布 Every Eval Ever(EEE)与 Community Evals 互通,支持交叉发布评测结果并链接完整 EEE 记录,官方账号提交的结果在 EvalEval 显示认证标记。
Treble Technologies 与 Hugging Face 联合推出 FFASR Leaderboard,首个开放的社区驱动远场 ASR 基准,覆盖 14 个模拟房间并与实测数据做了 sim-to-real 验证。
Google Chrome 团队的 Thomas Steiner 在 Transformers.js 中实验了尚处早期提案阶段的 Cross-Origin Storage API。
PaddlePaddle 发布 PP-OCRv6,提供 tiny、small、medium 三档模型,参数量从 1.5M 到 34.5M,medium 和 small 档支持 50 种语言。
Hugging Face 博客介绍了 localpager 系统,用 pi agent harness 加受限只读 shell reposhell,在 NVIDIA GB10(DGX Spark。
推荐理由:作者分享了本地模型加受限 shell 做高吞吐分类的完整配方,附带 330 条评测对比,可迁移到其他信息过滤场景。
Hugging Face 在 PEFT 库中 added LLM 数学微调和图像生成两个基准,用相同模型、数据、代码和硬件对比 40 多种 PEFT 技术,并追踪 VRAM、遗忘、运行时间和 checkpoint 大小等指标。
推荐理由:Hugging Face 用统一条件的基准实测多种 PEFT 技术,给出 LoRA 并非处处最优的证据和其他技术在两个任务上的具体取舍数据。
Hugging Face 发布 agent-eval 基准工具,不只看最终答案,而是测量智能体完成任务所需的轮次、token、时间和失败情况,全部由开源模型通过 pi 编码智能体驱动并跑在 Hugging Face Jobs 上。
AWS 开源 SDK Strands Robots 将 LeRobot 栈封装为 AgentTools,可用单个 Strands agent 完成录制演示数据、运行策略、部署到实体 SO-101 和多机器人协调。
推荐理由:AWS 官方 walkthrough 给出从 Hub 数据集到实体 SO-101 机器人的完整可运行示例,仿真与硬件共享同一 LeRobotDataset 格式,可迁移到自己的机器人工作流。
智谱发布旗舰模型 GLM-5.2,面向长时程任务,首次在稳定的 1M-token 上下文上交付该能力,采用 MIT 开源协议。架构上提出 IndexShare,每 4 层稀疏注意力共享一个 indexer,1M 上下文下每 token FLOPs 降低 2.9 倍,并改进 MTP 层使投机解码接受长度最多提升 20%。
推荐理由:官方技术报告给出 1M 上下文的架构改进和三项长时程基准对比,读者可以借此评估开源模型在真实编码场景的可用性。
Google DeepMind 发布基于文本扩散的开源实验模型 DiffusionGemma,采用 Apache 2.0 协议,权重已在 Hugging Face 上提供。
推荐理由:官方说明了文本扩散模型的架构取舍与适用场景,读者可据此判断它是否适合本地低并发的高吞吐需求。
Google DeepMind 发布 Gemma 4 12B,采用无编码器的统一多模态架构,视觉和音频输入直接进入 LLM backbone,支持原生音频输入。
推荐理由:原文给出了架构细节、内存门槛和许可证等可验证事实,读者可据此评估本地部署多模态模型的可行性。
Hugging Face 工程师让一个编码 Agent 通过调用两个 Spaces(ideogram-ai/ideogram4 图像生成和 VAST-AI/TripoSplat 单图转 3D Gaussian splat)搭建了巴黎地标 3D 画廊 mishig/monuments-de-paris,全程未手动使用图像生成或 3D 工具。
推荐理由:作者亲历一次完整流水线复现,给出可复用的 agents.md 调用方法和链式组合思路,读者可照做搭建自己的多媒体 Agent 应用。
Hugging Face 宣布 OpenEnv 转为由多方委员会协调的开源项目,委员会成员包括 Meta-PyTorch、Unsloth、Modal、Nvidia、Microsoft 等。
Reachy Mini 对话应用现在可以通过 MCP 调用托管在公开 Hugging Face Spaces 上的远程工具,无需修改应用即可为机器人添加查天气、搜索网页等新能力。
Hcompany 发布 Holo3.1 系列 Computer Use 模型,提供 0.8B、4B、9B 和 35B-A3B 四种尺寸。
推荐理由:官方给出各尺寸在 OSWorld 与 AndroidWorld 的量化后表现和部署路径,读者可据此评估本地 Computer Use Agent 的可行性。
JetBrains 发布 Mellum2,一个总参数 12B、每 token 仅激活 2.5B 的开源 Mixture-of-Experts 模型,在自然语言和代码语料上从头训练,采用 Apache 2.0 许可证。
Hugging Face 在 TRL 中合入 Delta Weight Sync 功能(PR huggingface/trl#5417),将相邻 RL 步之间约 99% 未变化的 bf16 权重剔除,只编码变化元素为稀疏 safetensors 文件,经 Hub Bucket 供 vLLM 拉取。
Hugging Face 的 Tom Aarsen 发布 ettin-reranker-v1 系列,含 17M 到 1B 六个 Sentence Transformers CrossEncoder 重排序模型,基于 Ettin ModernBERT 编码器,Apache 2.0 许可,支持最长 8192 token 上下文。
推荐理由:作者公开了六个模型、完整训练脚本和1.43亿条蒸馏数据,并给出与主流reranker的速度和精度对比,便于按规模选型或自行复现训练。
PaddleOCR 3.5 通过新增 engine 参数让支持的模型(如 PP-OCRv5、PaddleOCR-VL 1.5)可用 Hugging Face Transformers 作为推理后端,并提供 engine_config 配置 dtype、设备与 attention 实现等选项。
IBM 发布 Granite Embedding Multilingual R2 两款 Apache 2.0 多语言嵌入模型:97M 紧凑版在 MTEB Multilingual Retrieval 得 60.3。
推荐理由:原文给出完整基准数据、训练方法与框架集成示例,读者可按规模和场景直接选型。
Berkeley AI Research 发布对并行推理领域的综述分析,主张让模型自主决定何时分解任务、并行多少线程以及如何协调。文章指出串行推理 token 线性增长会导致上下文过载(context-rot)和长达数十分钟的延迟,并评述了 ParaThinker、GroupThink、Hogwild! Inference 等近期方法,指出现有方法的并行结构仍由外部固定设定,而非模型自适应决定。
Google Research 阐述其开放科学理念,通过开源工具、开放数据集与全球科研合作推动科学进步,已服务超过 250,000 名研究者和开发者。
IBM Granite 团队发布 Granite 4.1 系列 dense 模型,含 3B、8B、30B 三个规模,在约 15T tokens 上训练,上下文经长文本扩展达 512K,均以 Apache 2.0 许可开源。
推荐理由:原文完整披露了五阶段预训练、SFT 质控和四阶段 RL 的训练配方,8B 稠密模型对标上一代 32B-A9B MoE 的结果也可供选型参考。
DeepInfra 现已成为 Hugging Face Hub 支持的 Inference Provider,为开发者提供按 token 计价的低成本 serverless 推理服务。
DeepSeek 发布 V4,在 Hub 上开源 DeepSeek-V4-Pro(1.6T 总参数 / 49B 激活)和 DeepSeek-V4-Flash(284B 总参数 / 13B 激活)两个 instruct 及对应 base 检查点,均支持 1M token 上下文。
推荐理由:文章拆解了 V4 为长上下文与 Agent 场景做的架构与后训练设计,读者可据此评估开源模型跑长任务的部署成本。
Hugging Face 推出 QIMMA(قِمّة,意为“峰顶”),先对基准做质量校验再评估模型,确保分数反映真实的阿拉伯语能力。QIMMA 整合 14 个基准的 109 个子集、超 52,000 样本,覆盖文化、STEM、法律、医疗、安全、文学和代码 7 个领域,99% 为原生阿拉伯语内容。
Hugging Face 发文分析网络安全进入 AI 加速时代后的格局,认为关键在于模型所嵌入的系统而非模型本身,开放生态可在检测、验证、协调、补丁四个阶段分散风险、缩小攻防能力差距。文章主张防御方采用半自主 AI 智能体,配合开源安全工具在组织内部署,并保留人类审批与可审计的决策日志。
推荐理由:原文从 Mythos 出发分析开放生态为何是防御方的结构性优势,并给出半自主智能体的可行防御路线。
Google Research 的 MoGen 模型基于 PointInfinity point cloud flow matching,用 1,795 条经人工验证的小鼠轴突训练生成合成神经元形态,扩充 PATHFINDER 重建模型的训练数据。