Hugging Face 收购 XetHub,将替换 Git LFS 作为 Hub 存储后端
Hugging Face 官方宣布收购总部位于西雅图的 XetHub,团队来自曾在 Apple 构建内部 ML 基础设施的 Yucheng Low、Ajit Banerjee 和 Rajat Arya。
推荐理由:收购方官方说明整合路径,给出了 Git LFS 换自研存储后对大文件更新方式的具体改变和当前 Hub 规模数据。
Hugging Face 官方宣布收购总部位于西雅图的 XetHub,团队来自曾在 Apple 构建内部 ML 基础设施的 Yucheng Low、Ajit Banerjee 和 Rajat Arya。
推荐理由:收购方官方说明整合路径,给出了 Git LFS 换自研存储后对大文件更新方式的具体改变和当前 Hub 规模数据。
Google 在 Gemma 2 发布一个月后推出三款新模型:2.6B 参数的 Gemma 2 2B(含 base 和 instruct 版本,适合端侧使用)、基于 Gemma 2 的安全分类器系列 ShieldGemma(2B/9B/27B)以及覆盖 Gemma 2 2B 和 9B 每一层的开源稀疏自编码器套件 Gemma Scope。
推荐理由:原文详细给出 Gemma 2 2B 的端侧用法、辅助生成加速和两个配套工具的评测,对部署和模型解释研究都有可操作的参考价值。
Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。
推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。
Mistral AI 与 NVIDIA 联合发布 12B 模型 Mistral NeMo,支持 128k 上下文窗口,以 Apache 2.0 许可发布 base 与 instruct 权重,官方称其推理、世界知识和编码精度在该规模中达到 SOTA,可作 Mistral 7B 的直接替代。
推荐理由:官方原文给出 12B 规模、128k 上下文、Apache 2.0 权重和 Tekken 分词器的具体压缩数据,可据此评估其在 Mistral 7B 系统中的替换价值。
Mistral AI 发布 Mathstral,一个基于 Mistral 7B、面向 STEM 复杂多步推理的指令模型,与 Project Numina 合作产出,权重托管在 HuggingFace。
Mistral AI 发布 Mamba 架构的 Codestral Mamba,在 Albert Gu 和 Tri Dao 协助下训练,具备线性时间推理和理论无限序列建模能力,已测试 256k token 的上下文检索,参数量 7,285,403,648。
推荐理由:官方介绍了 Mamba 架构在线性推理和长序列上的特点、部署方式与许可证差异,读者可据此评估本地编码助手的可行性。
Hugging Face 发布 SmolLM 小型语言模型系列,提供 135M、360M 和 1.7B 三种参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方公开了小型模型的数据配比、训练细节和完整语料,同档评测结果与端侧部署信息都可查证,适合关心小模型训练的人参考。
Hugging Face 团队发布教程,讲解如何用 distilabel 从 Argilla 2.0 技术文档合成三元组数据,微调 BAAI/bge-base-en-v1.5 嵌入模型(结合 TripletLoss 与 MatryoshkaLoss)。
Numina 与 Hugging Face 合作微调的 NuminaMath 7B TIR 赢得首届 AIMO Progress Prize,在私有测试集 50 题中解出 29 题。
推荐理由:原文由获奖团队完整给出两阶段微调、SC-TIR 推理和防过拟合验证的做法,方法可迁移到数学推理模型训练。
Hugging Face 正在 Dataset Hub 上试验一项新功能,使用开源 PII 检测工具 Presidio 自动生成数据集中个人身份信息(PII)的报告。报告可帮助开发者在训练前评估数据集的 PII 风险,也帮助数据集所有者在发布前验证其 PII 过滤流程。Hugging Face 还感谢法国 CNIL 在 GDPR 合规方面提供的指导。
TRL 库现已支持对视觉语言模型做 DPO 偏好优化训练,官方博客以 Idefics2-8b 为例给出完整教程。
推荐理由:原文给出从数据格式化、显存估算到 LoRA 量化的完整 DPO 训练流程,读者可直接迁移到自己的 VLM 微调场景。
Hugging Face 宣布 Transformers 与 KerasHub 采用共享模型保存格式,KerasHub 现可直接加载 Hub 上 346,268 个 Transformers 库模型。
推荐理由:官方宣布 Transformers 与 KerasHub 共享模型保存格式,KerasHub 用户可直接加载 Hub 上 300K+ 模型并切换 TensorFlow、JAX 或 PyTorch 后端。
Hugging Face 宣布用户可在 Inference Endpoints 和 Spaces 上使用 Google Cloud TPU v5e 加速 AI 应用。
推荐理由:Hugging Face 官方宣布接入 Google TPU,给出了实例配置和价格,读者可据此评估推理部署的成本选项。
Hugging Face 为 Dataset Hub 的 Dataset Search 推出四项新功能:按模态(文本、图像、音频、表格等)、按行数大小、按存储格式、按兼容库筛选。行数信息基于文件元数据,元数据缺失时按前 5GB 内容估算。这些筛选可与 Language、Tasks、Licenses 等现有过滤器组合使用。
Google 发布开源大语言模型 Gemma 2,提供 9B 和 27B 两种参数规模,各有 base 与 instruction-tuned 版本,已上架 Hugging Face Hub。
推荐理由:Hugging Face 官方介绍 Gemma 2 四个开放权重模型的技术细节与生态集成,并给出 transformers、TRL 微调和 Inference Endpoints 部署的可用方法。
总部位于多伦多的知识产权 AI 公司 XLSCOUT 联合 Hugging Face Expert Support Program 推出专利嵌入模型 ParaEmbed 2.0,通过在专家精选的多领域专利数据上微调,准确率较 2023 年 10 月发布的 ParaEmbed 1.0 提升 23%。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划回顾了开源社区共建数据集的进展。
视觉演示软件公司 Prezi 加入了 Hugging Face Expert Support Program,由专属专家协助其将更小、更高效的开源模型整合进 ML 工作流,包括在管线中引入开源 re-ranker 模型,以比 LLM 更便宜、更快、更好地为演示文稿匹配图片与文本。
Hugging Face 发布博客,解释通过 Accelerate 使用 DeepSpeed 与 PyTorch FSDP 训练 Mistral-7B 时结果不一致的原因:DeepSpeed 默认把主权重上转 fp32,而 FSDP 原生不强制上转。
Stable Diffusion 3 Medium(2B 参数)现已在 Hugging Face Hub 开放,可通过 🧨 Diffusers 使用,并附 DreamBooth 与 LoRA 训练脚本。
推荐理由:Hugging Face 官方讲解了 SD3 的 MMDiT 架构与 Diffusers 用法,附内存与性能优化数据,可直接迁移到自己的推理和微调流程。
Hugging Face 解释为何要重新设计 Transformers 文档:内容随文本之外的模态、LLM 与优化时代增量堆积,显得杂乱难导航。改版将面向开发者,转向 code-first 和解决方案导向,并以灵活有机的结构取代僵化的 Diátaxis 分类,通过整合而非追加内容来统一文档体验。
Cubzh 和 Gigax 联合 Hugging Face 发布 NPC-Playground,一个可在浏览器直接体验的 3D 演示,玩家可与 LLM 驱动的 NPC 对话互动。
Mistral AI 发布首个代码生成模型 Codestral,为 22B 开源权重模型,训练数据覆盖 80+ 编程语言,支持 32k 上下文窗口和 fill-in-the-middle 机制。
推荐理由:官方原文给出 22B 参数、32k 上下文、80+ 语言和多个基准对比,读者可以据此评估它在代码补全场景中的位置。
Hugging Face 介绍其 Text Generation Inference(TGI)附带的 TGI Benchmarking 工具,用于在吞吐之外同时测量延迟(含 TTFT),帮助用户根据场景权衡调优 LLM 部署。
Hugging Face 发布教程,介绍如何使用 Sentence Transformers 库微调或从零训练嵌入模型,覆盖数据集、损失函数、训练参数、评估器和 Trainer 五个组件。
TII 发布开源模型系列 Falcon 2,包含 11B 基础 LLM 和具备图像理解能力的 11B VLM,训练数据超过 5000B token,支持英语及另外 10 种语言。
Hugging Face 与 AMD 合作,将 AMD Instinct MI300 GPU 深度集成到 Hugging Face 平台,用户在 Azure ND MI300x V5 上使用 transformers 和 text-generation-inference 无需改代码。
Hugging Face 宣布推出 Dell Enterprise Hub(dell.huggingface.co),用于在 Dell 平台上便捷地本地训练和部署开源模型。
Hugging Face 与 Microsoft 在 Microsoft Build 上深化合作,扩展 Azure Model Catalog 的 Hugging Face Collection,新增 Llama 3、Mistral 7B、Command R Plus、Qwen 1.5 110B 等,支持在 Azure AI Studio 一键部署。
Hugging Face 在 Transformers 中新增 KV Cache 量化功能,通过降低缓存精度显著减少长上下文生成的内存占用,同时保持生成质量。
Google 发布 PaliGemma 视觉语言模型系列,采用 SigLIP-So400m 图像编码器加 Gemma-2B 文本解码器的架构,提供 pt、mix、ft 三类checkpoint,支持 224x224、448x448、896x896 三种分辨率和 bfloat16、float16、float32 三种精度。
推荐理由:原文由官方介绍模型架构、三种checkpoint类型、基准分数和transformers推理微调用法,可作为上手PaliGemma的实用参考。
Hugging Face 与 LangChain 联合发布合作伙伴包 langchain_huggingface,由双方共同维护,旨在让 LangChain 用户更快用上 Hugging Face 生态的新功能。
Hugging Face 与 TII 推出 Open Arabic LLM Leaderboard(OALL),为阿拉伯语大模型提供专门的评测与比较平台,服务全球超 3.8 亿阿拉伯语使用者。
Hugging Face 发布 Transformers Agents 2.0,新增可基于过往观察迭代的 ReactCodeAgent 与 ReactJsonAgent,并支持社区智能体分享。
推荐理由:官方详解新 Agent 框架的设计原则与多智能体用例,并给出基准结果,开源模型表现可作选型参考。
Hugging Face 推出专门评估希伯来语大语言模型的开放排行榜,包含四个基准:希伯来语问答(HeQ 数据集)、情感分析、Winograd Schema 指代消解和英希翻译,均采用 few-shot 提示格式评测。
Hugging Face 团队发布 StarCoder2-15B-Instruct-v0.1,首个采用完全透明、许可开放管线的自对齐代码 LLM,无需人工标注或从专有大模型蒸馏数据。
Hugging Face 发布 JAT,一个基于 Transformer 的多用途智能体项目,包含 Gato 的开放复现:发布了覆盖 Atari、BabyAI、Meta-World、MuJoCo 等环境的大量专家 RL 智能体、首个通用智能体训练数据集 JAT dataset(含数十万条专家轨迹)以及可玩电子游戏、控制机器人、执行导航指令的 JAT 模型。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
Mistral AI 开源发布 Mixtral 8x22B,采用 Apache 2.0 许可证。该稀疏 MoE 模型总参数 141B、激活参数仅 39B,支持英语、法语、意大利语、德语和西班牙语,具备函数调用能力与 64K tokens 上下文窗口,官方称其速度快于任何稠密 70B 模型。
推荐理由:官方给出了参数结构、许可证和基准成绩,读者可据此评估它在大模型开源阵营中的性价比和适用场景。
Hugging Face 博客介绍 Gradio 的 reload 模式,用 gradio app.py 代替 python app.py 启动即可在不重启服务器的情况下载入最新代码改动。