Meta 开源多模态模型 Muse Glimmer-30B,主打本地智能体场景
Meta 发布 30B 参数开源多模态模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,定位于本地智能体场景如编码、文档分析和个人助理。
推荐理由:原文给出架构细节、跑分对比和多套部署方案,读者可据此评估其在本地多模态智能体场景的可用性。
Meta 发布 30B 参数开源多模态模型 Muse Glimmer,从 Muse 蒸馏而来,采用 Apache 2.0 许可,定位于本地智能体场景如编码、文档分析和个人助理。
推荐理由:原文给出架构细节、跑分对比和多套部署方案,读者可据此评估其在本地多模态智能体场景的可用性。
Hugging Face 宣布 OpenEnv 转为由多方委员会协调的开源项目,委员会成员包括 Meta-PyTorch、Unsloth、Modal、Nvidia、Microsoft 等。
Berkeley AI Research 提出 GRASP,一种基于梯度的世界模型规划器,让长时程规划更稳定可靠。其核心做法有三点:把轨迹提升到虚拟状态使优化在时间上并行、在状态迭代中直接引入随机性以实现探索、重塑梯度让动作获得干净的信号并避开脆弱的“状态-输入”梯度。
OpenMed 构建了覆盖结构预测、序列设计与密码子优化的端到端蛋白质 AI 流水线。在对比多种 transformer 架构后,CodonRoBERTa-large-v2 胜出,困惑度 4.10、Spearman CAI 相关性 0.40,显著超过 ModernBERT;团队随后扩展到 25 个物种,用 55 GPU 小时训练了 4 个生产模型,建立了其他开源项目没有的物种条件化系统。
Turing 在 Meta 与 Hugging Face 的开源框架 OpenEnv 上构建了生产级日历管理环境 Calendar Gym,用于在访问控制、时间推理和多智能体协调等真实约束下评估工具调用智能体。
Hugging Face 团队推出 Alyah(意为阿联酋方言中的"北极星"),一个评测阿拉伯语大模型阿联酋方言能力的基准,包含 1,173 个由母语者人工采集的多选题样本,覆盖问候语、诗歌、历史遗产和方言语言等类别。
Meta-PyTorch 与 Hugging Face 联合推出 OpenEnv Hub,一个共享开放的智能体环境社区平台,同时发布 OpenEnv 0.1 规范(RFC)征集社区反馈。
BigCode 发布 BigCodeArena,一个通过真实执行来评判代码生成模型的人类投票平台,支持 10 种语言和 8 种执行环境,开放无需注册。上线 5 个月收集 14K 对话、4700+ 偏好投票,Elo 排名中 o3-mini 和 o1-mini 居首。
推荐理由:基于5个月社区执行评估数据发布代码生成评测平台,给出分语言和执行环境的模型表现差异与两个新基准。
Meta 的 Hugging Face 团队发布 GAIA 后续基准 Gaia2 和配套开源框架 Meta Agents Research Environments(ARE),Gaia2 数据集采用 CC BY 4.0 许可,ARE 采用 MIT 许可。
推荐理由:官方发布新基准 Gaia2 和开源评估框架 ARE,含七类任务和主流模型结果,便于开发者调试和评估自己的 Agent。
Arm 宣布 ExecuTorch 0.7 beta 中 KleidiAI 默认启用,为 Arm CPU 设备带来自动加速,无需开发者改代码。
NVIDIA 的 AI-Q Blueprint 在 Hugging Face DeepResearch Bench「LLM with Search」榜单登顶,总分为 40.52(截至 2025 年 8 月),是目前完全开源授权方案中的第一名。
Featherless AI 成为 Hugging Face Hub 支持的 Inference Provider,用户可在模型页面直接使用其 serverless 推理服务。
Hugging Face 发布长文,回顾 2024 年 4 月以来视觉语言模型(VLM)的关键变化与趋势。
推荐理由:Hugging Face 系统梳理了过去一年 VLM 的新架构、多模态 RAG、智能体与安全模型,可作为领域入门与选型参考。
Meta 发布 Llama 4 Maverick(约 400B、128 专家)和 Scout(约 109B、16 专家),均为 17B 激活参数的 MoE 原生多模态模型,在最多 40 万亿 token、200 种语言数据上训练。
推荐理由:官方公告给出两款模型的参数、上下文长度与架构细节,读者可以据此评估部署门槛和与 transformers 的集成方式。
Hugging Face Diffusers 团队发文综述当前开源视频生成模型现状,覆盖 CogVideoX、Mochi-1、HunyuanVideo、LTX Video 等模型及其高资源需求、泛化与延迟等局限。
推荐理由:Diffusers 团队原文梳理了开源视频生成模型现状,并给出实测内存数据和一套可复用的推理与微调优化方法。
Hugging Face 博客以迭代推导方式讲解位置编码设计,从整数编码、二进制编码到正弦编码,最终推导出 Llama 3.2 等现代 Transformer 采用的 RoPE。
推荐理由:文章把 RoPE 的设计过程拆成可跟随的迭代推导,从整数编码一步步走到旋转矩阵,适合想理解位置编码原理的读者。
Hugging Face 详解 LayerSkip 提出的 self-speculative decoding:用同一模型的浅层生成草稿 token、深层做验证,兼得加速、内存节省与更低延迟。
Hugging Face 与 Atla 推出 Judge Arena 平台,让用户对两个 LLM 评判模型在同一测试样本上的打分与理由进行投票,结果以 Elo 分数汇入每小时更新的公开排行榜。
Llama 3.2 两周前登陆 Hugging Face/Transformers,而 Keras 从第一天起就支持它,可直接从 safetensors 格式的 Hugging Face checkpoint 加载,如 "hf://meta-llama/Llama-3.2-1B-Instruct"。
Meta 发布 Llama 3.2,Hugging Face 上线 10 个开放权重模型,包括 11B 和 90B 两个视觉模型(各有 base 与 instruct 版本)以及 1B 和 3B 两个可端侧运行的文本模型。
推荐理由:原文来自 Hugging Face 官方,详细说明了 Vision 与端侧小模型的规模、显存需求、许可证限制和上手方式,适合据此评估是否采用。
Hugging Face 发布把 Llama3 8B 微调到 BitNet 1.58 比特(三元权重 -1/0/1)的方法,模型在 HF1BitLLM 组织开源,其中两个在 10B tokens 上训练、一个在 100B tokens 上训练,MMLU 成绩超过 Llama 1 7B。
这篇 Hugging Face 教程讲解如何在 Google Cloud A3 节点(8 x H100)上,用 TGI 的 Deep Learning Containers 在 Vertex AI 上部署 Meta Llama 3.1 405B 的 FP8 量化版 Meta-Llama-3.1-405B-Instruct-FP8。
Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。
推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。
Meta 发布开源评测框架 CyberSecEval 2,用于评估 LLM 在生成不安全代码、提示词注入、协助网络攻击、代码解释器滥用和自动化攻击能力等方面的安全风险。评测显示,LLM 平均协助网络攻击的合规率已从上一版的 52% 降至 28%;提示词注入防护仍未解决,模型在端到端漏洞利用上能力有限。全部代码开源,并提供 leaderboard,欢迎社区贡献。
Hugging Face 与 AMD 合作,将 AMD Instinct MI300 GPU 深度集成到 Hugging Face 平台,用户在 Azure ND MI300x V5 上使用 transformers 和 text-generation-inference 无需改代码。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
开源人形机器人 Reachy 的开发商 Pollen Robotics 发布开源库 pollen-vision,提供面向机器人的零样本视觉模型统一接口,无需训练即可开箱使用。
Hugging Face 发布教程,演示如何用 facebook/w2v-bert-2.0 checkpoint 和 CTC 在 Common Voice 16.0 约 14 小时的蒙古语数据上微调 Wav2Vec2-BERT。
Hugging Face 宣布 🤗 optimum-neuron 已支持在 AWS Inferentia2 上部署 LLM 进行文本生成,并以 Llama 2 7B 和 13B 为例演示。
Hugging Face 发布面向非工程师的教程,用 Spaces、AutoTrain 和 ChatUI 三个工具,无需写代码即可微调 Llama 2 并部署聊天应用。教程分三步:创建 AutoTrain Space、用 Alpaca 指令数据集微调模型(示例用 7b 基座模型)、再用 ChatUI 模板部署成可分享的聊天应用。
Hugging Face 发布了一项针对 Llama 2 在 Amazon SageMaker 上部署的基准测试,分析了 60 种不同部署配置。测试覆盖 7B、13B、70B 三种参数规模,在 g5 与 p4d 系列 EC2 实例上,以 1/5/10/20 并发请求,比较有无 GPTQ 4-bit 量化的延迟与吞吐。
Hugging Face 团队发布教程,讲解如何用 PyTorch FSDP 在 2 节点共 16 张 A100 80GB 上全参数微调 meta-llama/Llama-2-70b-chat-hf,训练耗时约 13.5 小时。
Hugging Face 发布 Code Llama 系列开源代码模型集成,含 7B、13B、34B 三种规格,基于 Llama 2 在 500B token 代码数据上训练,提供 Python 特化版和指令微调版。
推荐理由:官方完整介绍了模型规格、上下文扩展原理和生态接入方式,读者可以直接据此选择规格并上手部署使用。
Hugging Face 官方博客介绍 TRL 库新支持的 DPO 方法,无需奖励模型和 RL 步骤即可直接在偏好数据上优化语言模型。
推荐理由:原文提供了从 SFT 到 DPO 微调 Llama v2 的完整代码与训练脚本,读者可复用到自己的数据集上。
Hugging Face 发布教程,讲解如何通过 Inference Endpoints 和自定义 handler 部署 MusicGen 音乐生成模型。
Meta 发布 Llama 2 系列开放模型,包含 7B、13B、70B 预训练及微调版本,采用可商用的 Llama 2 许可证,Hugging Face 同步完成集成并上线全部 12 个模型。
推荐理由:官方完整梳理了 Llama 2 的许可、规格与 HF 生态推理微调路径,读者可据此快速上手开源替代方案。
Hugging Face 团队调查 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数低于论文报告值的原因,发现同一 MMLU 数据集存在 Original、HELM 和 EleutherAI Harness 三种实现。
Meta AI 的 MMS 支持 1100 多种语言的语音识别、语言识别与语音合成,其无监督 checkpoint 在 1400 多种语言、超 50 万小时音频上预训练,参数规模为 300M 和 1B。
Meta AI 开源的文本表示与分类库 fastText 现已登陆 Hugging Face Hub,官方镜像了全部 157 种语言的词向量及最新语言识别模型,用户通过 huggingface_hub 几条命令即可下载使用。此次集成还支持文本分类与特征提取 widget,并提供预训练向量加载、最近邻查询和语言检测的用法示例。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练教程,演示如何将 LLaMA 7B 微调用于回答 Stack Exchange 问答。
推荐理由:Hugging Face 官方复盘 StackLLaMA 全流程训练细节,包括显存估算、LoRA 配置和 RLHF 训练中的稳定性坑,方法可直接迁移复用。