中国 AI 全球化扩张简析:巨头与初创为何出海、如何出海
Hugging Face 博客发文综述中国 AI 企业的全球化扩张。截至 2024 年,全球 1500 家活跃 AI 公司中 751 家在中国,其中 103 家已出海。
Hugging Face 博客发文综述中国 AI 企业的全球化扩张。截至 2024 年,全球 1500 家活跃 AI 公司中 751 家在中国,其中 103 家已出海。
OpenAI 在平台上推出模型蒸馏功能,可用大型前沿模型的输出对更具成本效率的模型进行微调。该功能在 OpenAI 平台内完成,链接为 https://openai.com/index/api-model-distillation。
Hugging Face 发布 FineVideo 数据集,包含 43k 段视频共 3.4k 小时,附丰富描述、叙事细节、场景切分和 QA 对,并撰文披露完整构建流程。
Hugging Face 发布把 Llama3 8B 微调到 BitNet 1.58 比特(三元权重 -1/0/1)的方法,模型在 HF1BitLLM 组织开源,其中两个在 10B tokens 上训练、一个在 100B tokens 上训练,MMLU 成绩超过 Llama 1 7B。
Hugging Face 宣布在 Hub 上推出 SQL Console,用户在每个数据集页面点击徽标即可运行 SQL 查询。查询由 DuckDB WASM 在浏览器本地完成,无需服务器,支持导出 Parquet 和通过链接分享结果;数据集前 5GB 会自动转换为 Parquet。
推荐理由:官方介绍浏览器内 SQL 查询数据集的能力与限制,文中示例可直接迁移到自己的数据集格式转换工作流。
Hugging Face LeRobot 团队提出 LeRobotDataset 格式,用视频编码存储机器人数据集的视觉模态,数据集平均仅为其原大小的 14%(最佳情况可达 0.2%),且保持完整训练能力。解码方面,单帧加载时间与 PNG 压缩图像相当,解码多连续帧时仅为 PNG 加载时间的 25%-50%。该格式轻量、易分享(与 Hub 原生集成)并配有在线可视化工具。
Hugging Face 通过新 PR 和 DataCollatorWithFlattening 使无填充打包的指令微调训练兼容 Flash Attention 2,TRL 的 SFTTrainer 也可通过 padding_free=True 使用。
Hugging Face 复现 Google 的 Infini-attention 论文后发现,压缩记忆次数越多,性能反而越差,90% 的时间花在调试收敛问题上。
阿布扎比 TII 基于 Mamba 架构发布开源模型 Falcon Mamba 7B,采用 TII Falcon Mamba 7B License 1.0,称在 LLM Leaderboard 两版基准上平均分领先多数同类 Transformer 与 SSM 模型。
推荐理由:原文给出架构设计、训练数据和两版评测基准数字,读者可据此判断无注意力 7B 模型与主流 Transformer 的差距。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的多模态数据增强 pipeline,可同时修改图像内容与文本标注,用于 VLM 微调。
Hugging Face 在开发 Docmatix 时发现,在其上微调的 Florence-2 在 DocVQA 上表现出色,却因答案格式差异在传统指标上得分很低,额外针对 DocVQA 微调反而被人工评估认为更差。
Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。
推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的大型数据集,含 240 万张图像和 950 万问答对,来自 130 万份 PDF,规模为此前数据集的 240 倍。
Hugging Face 在 TGI 中推出 Multi-LoRA serving,只部署一次基座模型 mistralai/Mistral-7B-v0.1,即可按请求动态选择 LoRA 适配器,一次部署相当于服务多个微调模型。
推荐理由:原文给出部署步骤、显存开销和成本对比数据,读者可以据此评估一次部署服务多个微调模型是否适合自己的场景。
Hugging Face 发布 SmolLM 小型语言模型系列,提供 135M、360M 和 1.7B 三种参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方公开了小型模型的数据配比、训练细节和完整语料,同档评测结果与端侧部署信息都可查证,适合关心小模型训练的人参考。
Hugging Face 团队发布教程,讲解如何用 distilabel 从 Argilla 2.0 技术文档合成三元组数据,微调 BAAI/bge-base-en-v1.5 嵌入模型(结合 TripletLoss 与 MatryoshkaLoss)。
Hugging Face 正在 Dataset Hub 上试验一项新功能,使用开源 PII 检测工具 Presidio 自动生成数据集中个人身份信息(PII)的报告。报告可帮助开发者在训练前评估数据集的 PII 风险,也帮助数据集所有者在发布前验证其 PII 过滤流程。Hugging Face 还感谢法国 CNIL 在 GDPR 合规方面提供的指导。
Hugging Face 为 Dataset Hub 的 Dataset Search 推出四项新功能:按模态(文本、图像、音频、表格等)、按行数大小、按存储格式、按兼容库筛选。行数信息基于文件元数据,元数据缺失时按前 5GB 内容估算。这些筛选可与 Language、Tasks、Licenses 等现有过滤器组合使用。
Hugging Face 伦理与社会通讯第 6 期探讨 AI 数据质量:Reddit 与 Google 的内容合作因 RAG 搜索引擎输出“披萨加胶水”等错误推荐而受挫,说明并非所有数据都同样优质。好数据的关键在于与任务匹配,需具备相关性、全面性、时效性并缓解偏见。文章还阐述高质量数据可提升模型性能、鲁棒性、效率与可复现性,并建议通过去重、内容过滤、人工反馈和数据治理框架来保障质量。
Hugging Face 发布 Florence-2 微调教程。微软 2024 年 6 月发布的 Florence-2 有 0.2B 和 0.7B 两种规模,官方模型不含 VQA 能力。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划回顾了开源社区共建数据集的进展。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)在线 RLHF 训练器,作为 PPO 的替代方案。
Mistral 在 la Plateforme 推出模型定制能力,提供三条路径:开源微调 SDK mistral-finetune(基于 LoRA,可在自有基础设施微调全部开源模型)、平台无服务器微调服务(兼容 Mistral 7B 和 Mistral Small,后续数周将新增模型)以及面向特定客户、支持持续预训练的定制训练服务。
推荐理由:官方同时开放自托管微调 SDK、平台托管服务与定制训练三条路径,读者可据此对比选择适合自己的模型定制方式。
ChatGPT 发布一年多后,OpenAI 阐述了其在 AI 时代的数据处理方法。公司同时推出 Media Manager,供创作者和内容所有者管理自己的内容,并介绍了未来方向。
Hugging Face 团队发布 StarCoder2-15B-Instruct-v0.1,首个采用完全透明、许可开放管线的自对齐代码 LLM,无需人工标注或从专有大模型蒸馏数据。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
OpenAI 为 fine-tuning API 新增多项功能,帮助开发者更精细地控制微调流程,同时宣布扩展自定义模型(custom models)计划的合作方式,为开发者提供更多基于 OpenAI 模型构建定制模型的选择。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。
Argilla 与 Hugging Face 发起 Data is better together 实验,几天内吸引 350 位社区贡献者,完成超过 11,000 次提示词评分,并发布含 10,000 条带评分提示词的数据集 10k_prompts_ranked。
Hugging Face 发布 Gemma 模型微调教程,演示用 Transformers、PEFT 与 trl 的 SFTTrainer,通过 LoRA 和 4-bit QLoRA(bitsandbytes、nf4 量化)在 google/gemma-2b 上以 english_quotes 数据集训练模型按指定格式输出名言和作者。
推荐理由:Hugging Face 官方用 LoRA 和 4-bit QLoRA 给出 Gemma 微调的完整可复现代码,覆盖 GPU 和 TPU 两种路径。
Hugging Face 发布教程,展示用 Mixtral-8x7B-Instruct-v0.1 生成合成数据,再通过 AutoTrain 微调 RoBERTa-base 做金融新闻情绪分类。
推荐理由:原文给出可复用的合成数据蒸馏流程和成本对比数字,读者可以照此把自己的分类任务从 LLM API 迁到专用小模型。
Hugging Face 团队在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个模型上,用 MT-Bench 实测了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法。
Hugging Face 发布 2023 年开源大语言模型年度回顾,指出开源模型可复现研究、便于社区参与和审查模型偏差,并通过复用 checkpoint 降低碳排放。
Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。
推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。
Intel Labs 与 Hugging Face 推出 SetFitABSA,一个无需提示词的少样本方面级情感分析(ABSA)框架。方法分三步:spaCy 抽取候选方面、SetFit 二分类筛选方面、第二个 SetFit 模型为每个方面标注情感极性;训练数据只需简单的 text/span/label/ordinal 表格格式。
OpenAI 推出数据合作伙伴计划,与组织合作创建用于 AI 训练的开源和私有数据集。该计划旨在让更多领域的深层信息进入模型训练,合作方可选择数据集的开放或私有方式。
Hugging Face 博客用 LoRA 在灾难推文二分类任务上对比 RoBERTa-large、Llama-2-7b 和 Mistral 7B,均在单张 48GB A6000 上微调。
Explosion 上周推出 Prodigy-HF 插件,将 Prodigy 标注工具直接集成 Hugging Face 生态。
Hugging Face 官方博客介绍如何用一行 spotlight.show(ds) 代码,通过 Renumics Spotlight 交互式可视化 datasets 库中的数据集,无需复制或预处理数据。
Hugging Face 发布技术博客,复现 OpenAI 2019 年 RLHF 代码库 openai/lm-human-preferences,在情感和描述性等风格任务上匹配了原始学习曲线,并整理出实现细节清单。