Hugging Face 发布 Synthetic Data Generator,用自然语言生成自定义数据集
Hugging Face 发布 Synthetic Data Generator,一款无代码应用,通过三步流程(描述数据集、配置微调、生成推送)用 LLM 从自定义提示词生成数据集,底层由 distilabel 和免费 Hugging Face 文本生成 API 驱动。
推荐理由:官方介绍这款无代码合成数据工具的完整流程与可配置项,读者可据此判断能否用自然语言快速搭建数据集和模型。
Hugging Face 发布 Synthetic Data Generator,一款无代码应用,通过三步流程(描述数据集、配置微调、生成推送)用 LLM 从自定义提示词生成数据集,底层由 distilabel 和免费 Hugging Face 文本生成 API 驱动。
推荐理由:官方介绍这款无代码合成数据工具的完整流程与可配置项,读者可据此判断能否用自然语言快速搭建数据集和模型。
Hugging Face 的热门开源模型现已可通过 Amazon Bedrock Marketplace 部署,共提供 83 个开源模型。
Hugging Face 的 Data is Better Together 社区发布 Apache 2.0 许可的文本生成图像偏好数据集 open-image-preferences-v1,包含 10K 偏好对、超 30K 标注响应,由 250 多名社区成员在不到两周内完成。
Google 发布视觉语言模型 PaliGemma 2,将 SigLIP 图像编码器与 Gemma 2 语言模型结合,提供 3B、10B、28B 三种规模,支持 224x224、448x448 和 896x896 三种输入分辨率。
推荐理由:Google 发布 PaliGemma 2 视觉语言模型,提供 3B、10B、28B 三种规模与多分辨率选择,并附 transformers 集成和微调脚本。
Hugging Face 发布面向阿拉伯语 LLM 的生成式评测基准与排行榜 AraGen,并推出新的 NLG 评测指标 3C3H。3C3H 基于 LLM-as-judge,从正确性、完整性、简洁性、有用性、诚实性与无害性六个维度评估模型回答,兼顾事实性与可用性。排行榜采用动态评测:数据集和评测代码先私有盲测三个月,到期后公开并更换新数据集,以缓解数据污染问题。
Hugging Face 发布开源开发者 EU AI Act 合规指南,说明该法案适用于欧盟内受影响的开源 AI 系统和模型。
推荐理由:面向开源开发者的指南,把 AI Act 的风险分级拆成文档、水印、opt-out 等可操作步骤,并给出 Hugging Face 现成工具。
Hugging Face 发布 2B 小型视觉语言模型 SmolVLM,含 Base、Synthetic 和 Instruct 三个版本,模型、数据集、训练配方均以 Apache 2.0 开源。
推荐理由:原文给出与同级 2B 模型的显存、token 编码和吞吐对比数据,可帮助读者评估端侧部署小 VLM 的实际成本。
Hugging Face Xet 团队正在重新设计 Hub 的上传与下载架构,在内容分发第一站插入内容寻址存储(CAS),采用“dumb reads and smart writes”理念在字节级处理文件。
Hugging Face 与跨组织项目 LLM-jp 联合推出 Open Japanese LLM Leaderboard,用于集中评测和比较日语大语言模型。
Hugging Face 的 Xet 团队正用内容定义分块(CDC)替代 Git LFS 的文件级存储,只传输和保存修改过的 chunk,以提升 Hub 上 30 PB 模型、数据集与空间的存储效率。
Hugging Face 详解 LayerSkip 提出的 self-speculative decoding:用同一模型的浅层生成草稿 token、深层做验证,兼得加速、内存节省与更低延迟。
Hugging Face 与 Atla 推出 Judge Arena 平台,让用户对两个 LLM 评判模型在同一测试样本上的打分与理由进行投票,结果以 Elo 分数汇入每小时更新的公开排行榜。
Hugging Face Hub 提供数据集托管与分享服务,可承载 TB 级数据集,Xet 团队正将单文件上限从 50 GB 提升至 500 GB。平台内置 Dataset Viewer(支持全文搜索和排序)、SQL Console,并兼容 Pandas、Spark、DuckDB 等第三方库,多数库一行代码即可加载或流式读取数据集。
Hugging Face 发布 PyCharm 集成功能,开发者可在 IDE 内右键插入 HF 模型并自动获取示例代码。文章演示了用 microsoft/Phi-3.5-vision-instruct 十分钟内搭建图文对话应用,并介绍了悬停即显模型卡、本地模型缓存查看与清理等功能。该集成为 PyCharm Professional 专属,可用 PyCharm4HF 兑换 3 个月免费订阅。
Argilla 推出 2.4 新功能,无需写代码即可从 Hugging Face Hub 导入数据集并收集人工反馈。在 Argilla UI 中点击导入按钮即可开始,系统会根据数据集特征自动生成初始配置,可添加标签、评分、排序等问题;当前仅支持公开数据集,私有数据集支持尚未提供。该功能降低了领域专家参与数据集建设的门槛,部署推荐使用 Spaces 并默认启用 Hugging Face OAuth。
Cohere For AI 发布 Aya Expanse 8B 和 32B 开源权重模型。在 Arena-Hard-Auto 23 语言成对对比中,Aya Expanse 32B 胜过 Gemma 2 27B。
Hugging Face 发布 HUGS(Hugging Face Generative AI Services),为在自有基础设施中部署开源模型提供零配置的优化推理微服务。
dottxt 与 Hugging Face 合作推出 outlines-core 0.1.0,将 Outlines 结构化生成核心算法移植到 Rust 并提供 Python 绑定。索引编译速度平均提升 2x,且通过 Rust 提前编译消除了此前 Numba JIT 带来的首次运行延迟。该库轻量、关注点分离,未来可绑定到 Python 之外的语言,方便更多库集成结构化生成。
Hugging Face 发布 Transformers.js v3,经一年多开发后正式推出,WebGPU 加速可比 WASM 快至 100 倍,支持架构总数达 120 个,Hub 上预转换模型超过 1200 个。
推荐理由:官方发布说明给出 WebGPU 加速、量化选项和迁移方式,读者可以据此评估是否升级到 v3。
Stable Diffusion 3.5 Large 发布,提供 8B 基础版和 8B timestep-distilled 版两个 checkpoint,模型已在 Hugging Face Hub 开放并可在 🧨 Diffusers 中使用。
推荐理由:原文给出 Diffusers 中推理、量化加载和低显存训练 LoRA 的具体做法,读者可以直接照着在消费级硬件上使用 8B 模型。
Hugging Face 宣布与 Protect AI 合作,将后者的 Guardian 集成为第三方扫描器,自动扫描所有公开模型仓库。Guardian 可捕获 pickle 序列化和 Keras Lambda 层等格式中的任意代码执行漏洞,扫描结果已在新版前端展示,示例见 mcpotato/42-eicar-street;目前因超过 100 万模型仓库,部分模型可能暂未显示扫描结果。
Llama 3.2 两周前登陆 Hugging Face/Transformers,而 Keras 从第一天起就支持它,可直接从 safetensors 格式的 Hugging Face checkpoint 加载,如 "hf://meta-llama/Llama-3.2-1B-Instruct"。
Hugging Face Xet 团队研究提升 Hub 上 Parquet 文件的存储去重效率,目前 Hub 上 Parquet 文件占用超过 2.2PB 存储。
Hugging Face 博客发文综述中国 AI 企业的全球化扩张。截至 2024 年,全球 1500 家活跃 AI 公司中 751 家在中国,其中 103 家已出海。
Hugging Face 推出 BenCzechMark,这是首个也是目前最全面的捷克语大语言模型评测套件,包含覆盖 9 个类别的 50 个任务,其中 90% 为原生非翻译内容,涵盖阅读理解、事实知识、语法、语言建模、数学推理等维度。评测同时配套上线 BenCzechMark 排行榜,收录了超过 25 个不同规模的开源模型,并使用 Acc、EM、AUROC 和词级 Ppl 四类指标进行评分。
Hugging Face 发布教程,讲解如何将顶点着色网格转换为 UV 映射的带贴图网格,并开源了 InstantTexture 库实现一键转换。教程详解用 xatlas 生成 UV 映射、通过重心插值填充 1024 尺寸纹理,再结合 inpainting、中值滤波、高斯模糊和降采样消除纹理孔洞。这类顶点着色网格常见于 InstantMesh 等生成式 3D 模型的输出。
Meta 发布 Llama 3.2,Hugging Face 上线 10 个开放权重模型,包括 11B 和 90B 两个视觉模型(各有 base 与 instruct 版本)以及 1B 和 3B 两个可端侧运行的文本模型。
推荐理由:原文来自 Hugging Face 官方,详细说明了 Vision 与端侧小模型的规模、显存需求、许可证限制和上手方式,适合据此评估是否采用。
Hugging Face 介绍其 Daily Papers 页面的多项实用功能。过去一年该页面已收录超过 3,700 篇论文,订阅者超过 12k。用户可一键认领论文、提交推荐论文、@作者讨论、用 @librarian-bot 获取相似论文推荐,还能通过多语言评论翻译和 arXiv 扩展跳转体验相关 Space demo。
Hugging Face 发布 FineVideo 数据集,包含 43k 段视频共 3.4k 小时,附丰富描述、叙事细节、场景切分和 QA 对,并撰文披露完整构建流程。
Mistral AI 宣布 la Plateforme 推出免费层供实验、评估和原型开发,并对全系模型降价,Mistral Small 与 Codestral 降价 80%,Mistral Large 降价 33%。同时发布 22B 参数的 Mistral Small v24.09(MRL 许可),Pixtral 12B 以 Apache 2.0 许可在 le Chat 上免费提供图像理解能力。
推荐理由:原文给出 la Plateforme 免费层、全线降价幅度和新模型细节,读者可据此比较部署与成本选项。
Mistral 发布原生多模态模型 Pixtral 12B,采用从零训练的 400M 参数视觉编码器和基于 Mistral Nemo 的 12B 多模态解码器,以 Apache 2.0 协议开源。
推荐理由:官方披露了架构细节、基准数字和 Apache 2.0 开源协议,读者可以对比同规模开源多模态模型并评估迁移成本。
Hugging Face 宣布在 Hub 上推出 SQL Console,用户在每个数据集页面点击徽标即可运行 SQL 查询。查询由 DuckDB WASM 在浏览器本地完成,无需服务器,支持导出 Parquet 和通过链接分享结果;数据集前 5GB 会自动转换为 Parquet。
推荐理由:官方介绍浏览器内 SQL 查询数据集的能力与限制,文中示例可直接迁移到自己的数据集格式转换工作流。
Hugging Face 在 HuggingChat 上发布 Community Tools 功能,允许把任意公开 Space 转成模型可直接调用的工具,并借此扩展图像理解、视频生成和文本转语音等多模态能力。
推荐理由:官方介绍了把任意 Space 转成 HuggingChat 工具的做法,覆盖创建、配置参数和打包进助手的完整流程,读者可以照着复用。
Hugging Face 发布 Accelerate 1.0.0 的首个候选版本,该库在三年半间从简化 PyTorch 多 GPU/TPU 训练的工具,成长为 transformers、diffusers、peft、trl 等包的基础。
Hugging Face 宣布与 Truffle Security 合作,将开源工具 TruffleHog 的密钥扫描集成到平台。
Hugging Face 官方博客盘点 Hub 上五个常被忽视的工具:ZeroGPU(免费 A100 GPU,每工作负载 40GB vRAM)、多进程 Docker Space(用 supervisord)、Gradio API、Webhooks 和 Nomic Atlas 语义搜索。
推荐理由:作者用免费语义搜索项目实际串起 ZeroGPU、多进程 Docker、Gradio API、Webhooks 和 Nomic Atlas 的用法,附可直接复用的代码示例。
这篇 Hugging Face 教程讲解如何在 Google Cloud A3 节点(8 x H100)上,用 TGI 的 Deep Learning Containers 在 Vertex AI 上部署 Meta Llama 3.1 405B 的 FP8 量化版 Meta-Llama-3.1-405B-Instruct-FP8。
Hugging Face 发布 ggml 入门教程,介绍这个专注于 Transformer 推理的 C/C++ 开源机器学习库。教程讲解 ggml_context、ggml_cgraph、ggml_backend 等核心概念,给出在 Ubuntu 上编译运行矩阵乘法示例的完整步骤,并演示了使用 backend、打印计算图和导出 graphviz 格式的方法。
阿布扎比 TII 基于 Mamba 架构发布开源模型 Falcon Mamba 7B,采用 TII Falcon Mamba 7B License 1.0,称在 LLM Leaderboard 两版基准上平均分领先多数同类 Transformer 与 SSM 模型。
推荐理由:原文给出架构设计、训练数据和两版评测基准数字,读者可据此判断无注意力 7B 模型与主流 Transformer 的差距。
Hugging Face 宣布 Transformers 现已提供跨多个热门模型家族的统一工具调用 API,同一份代码可在 Mistral、Cohere、NousResearch 和 Llama 模型间基本无需修改地移植。
推荐理由:原文给出统一工具调用 API 的设计思路和完整代码示例,开源开发者可以照搬接入多个模型家族。