Hugging Face 发布 Synthetic Data Generator,用自然语言生成自定义数据集
Hugging Face 发布 Synthetic Data Generator,一款无代码应用,通过三步流程(描述数据集、配置微调、生成推送)用 LLM 从自定义提示词生成数据集,底层由 distilabel 和免费 Hugging Face 文本生成 API 驱动。
推荐理由:官方介绍这款无代码合成数据工具的完整流程与可配置项,读者可据此判断能否用自然语言快速搭建数据集和模型。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
Hugging Face 发布 Synthetic Data Generator,一款无代码应用,通过三步流程(描述数据集、配置微调、生成推送)用 LLM 从自定义提示词生成数据集,底层由 distilabel 和免费 Hugging Face 文本生成 API 驱动。
推荐理由:官方介绍这款无代码合成数据工具的完整流程与可配置项,读者可据此判断能否用自然语言快速搭建数据集和模型。
Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。
推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。
Hugging Face 发布开源开发者 EU AI Act 合规指南,说明该法案适用于欧盟内受影响的开源 AI 系统和模型。
推荐理由:面向开源开发者的指南,把 AI Act 的风险分级拆成文档、水印、opt-out 等可操作步骤,并给出 Hugging Face 现成工具。
Hugging Face 发布 2B 小型视觉语言模型 SmolVLM,含 Base、Synthetic 和 Instruct 三个版本,模型、数据集、训练配方均以 Apache 2.0 开源。
推荐理由:原文给出与同级 2B 模型的显存、token 编码和吞吐对比数据,可帮助读者评估端侧部署小 VLM 的实际成本。
Intel Labs 与 Hugging Face 推出 Universal Assisted Generation(UAG),通过双向 tokenizer 翻译让辅助生成不再要求目标模型与助手模型共享同一 tokenizer,可将任意 decoder 或 MoE 模型的推理加速 1.5x-2.0x 且几乎零开销。
推荐理由:原文解释了跨 tokenizer 助手模型的实现原理并给出多组加速数据,还提供 Transformers 4.46.0 的可用代码。
Google DeepMind 与 Hugging Face 在 Transformers v4.46.0 中发布 SynthID Text,可通过 g-function 与 tournament sampling 为任意 LLM 的 model.generate() 输出添加人眼不可见的水印。
推荐理由:原文给出水印的实现方式、配置参数与检测训练流程,开发者可以据此把 SynthID Text 接入现有生成调用。
Hugging Face 发布 Transformers.js v3,经一年多开发后正式推出,WebGPU 加速可比 WASM 快至 100 倍,支持架构总数达 120 个,Hub 上预转换模型超过 1200 个。
推荐理由:官方发布说明给出 WebGPU 加速、量化选项和迁移方式,读者可以据此评估是否升级到 v3。
Stable Diffusion 3.5 Large 发布,提供 8B 基础版和 8B timestep-distilled 版两个 checkpoint,模型已在 Hugging Face Hub 开放并可在 🧨 Diffusers 中使用。
推荐理由:原文给出 Diffusers 中推理、量化加载和低显存训练 LoRA 的具体做法,读者可以直接照着在消费级硬件上使用 8B 模型。
Hugging Face 宣布 Gradio 5 稳定版发布,目标是让开发者用几行 Python 构建可上生产的机器学习 Web 应用。
推荐理由:官方宣布 Gradio 5 稳定版,列出性能、UI、流式与安全等具体改动和升级命令,开发者可据此评估迁移与使用。
Meta 发布 Llama 3.2,Hugging Face 上线 10 个开放权重模型,包括 11B 和 90B 两个视觉模型(各有 base 与 instruct 版本)以及 1B 和 3B 两个可端侧运行的文本模型。
推荐理由:原文来自 Hugging Face 官方,详细说明了 Vision 与端侧小模型的规模、显存需求、许可证限制和上手方式,适合据此评估是否采用。
Hugging Face 宣布在 Hub 上推出 SQL Console,用户在每个数据集页面点击徽标即可运行 SQL 查询。查询由 DuckDB WASM 在浏览器本地完成,无需服务器,支持导出 Parquet 和通过链接分享结果;数据集前 5GB 会自动转换为 Parquet。
推荐理由:官方介绍浏览器内 SQL 查询数据集的能力与限制,文中示例可直接迁移到自己的数据集格式转换工作流。
Hugging Face 在 HuggingChat 上发布 Community Tools 功能,允许把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。
推荐理由:官方介绍了把任意 Space 转成 HuggingChat 工具的做法,覆盖创建、配置参数和打包进助手的完整流程,读者可以照着复用。
Hugging Face 官方博客盘点 Hub 上五个常被忽视的工具:ZeroGPU(免费 A100 GPU,每工作负载 40GB vRAM)、多进程 Docker Space(用 supervisord)、Gradio API、Webhooks 和 Nomic Atlas 语义搜索。
推荐理由:作者用免费语义搜索项目实际串起 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 的用法,附可直接复用的代码示例。
阿布扎比 TII 基于 Mamba 架构发布开源模型 Falcon Mamba 7B,采用 TII Falcon Mamba 7B License 1.0,称在 LLM Leaderboard 两版基准上平均分领先多数同类 Transformer 与 SSM 模型。
推荐理由:原文给出架构设计、训练数据和两版评测基准数字,读者可据此判断无注意力 7B 模型与主流 Transformer 的差距。
Hugging Face 宣布 Transformers 现已提供跨多个热门模型家族的统一工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch 和 Llama 模型间基本无需修改地移植。
推荐理由:原文给出统一工具调用 API 的设计思路和完整代码示例,开源开发者可以照搬接入多个模型家族。
Hugging Face 官方宣布收购总部位于西雅图的 XetHub,团队来自曾在 Apple 构建内部 ML 基础设施的 Yucheng Low、Ajit Banerjee 和 Rajat Arya。
推荐理由:收购方官方说明整合路径,给出了 Git LFS 换自研存储后对大文件更新方式的具体改变和当前 Hub 规模数据。
Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。
推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。
Hugging Face 发布教程,演示如何用 WWDC24 的新 Core ML 特性在 Mac 上复现 Mistral 7B 的端侧运行。
推荐理由:原文复现 WWDC24 的 Mistral 7B 端侧运行示例,讲解 MLTensor、状态缓存和 4-bit 量化等新特性与完整转换步骤。
Hugging Face 在 TGI 中推出 Multi-LoRA serving,只部署一次基座模型 mistralai/Mistral-7B-v0.1,即可按请求动态选择 LoRA 适配器,一次部署相当于服务多个微调模型。
推荐理由:原文给出部署步骤、显存开销和成本对比数据,读者可以据此评估一次部署服务多个微调模型是否适合自己的场景。
Hugging Face 发布 SmolLM 小型语言模型系列,提供 135M、360M 和 1.7B 三种参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方公开了小型模型的数据配比、训练细节和完整语料,同档评测结果与端侧部署信息都可查证,适合关心小模型训练的人参考。