Hugging Face 复现 Infini-Attention 失败:为何仍应继续尝试?
Hugging Face 复现 Google 的 Infini-attention 论文后发现,压缩记忆次数越多,性能反而越差,90% 的时间花在调试收敛问题上。
Hugging Face 复现 Google 的 Infini-attention 论文后发现,压缩记忆次数越多,性能反而越差,90% 的时间花在调试收敛问题上。
阿布扎比 TII 基于 Mamba 架构发布开源模型 Falcon Mamba 7B,采用 TII Falcon Mamba 7B License 1.0,称在 LLM Leaderboard 两版基准上平均分领先多数同类 Transformer 与 SSM 模型。
推荐理由:原文给出架构设计、训练数据和两版评测基准数字,读者可据此判断无注意力 7B 模型与主流 Transformer 的差距。
Hugging Face 与 Albumentations AI 合作推出面向文档图像的多模态数据增强 pipeline,可同时修改图像内容与文本标注,用于 VLM 微调。
Hugging Face 在开发 Docmatix 时发现,在其上微调的 Florence-2 在 DocVQA 上表现出色,却因答案格式差异在传统指标上得分很低,额外针对 DocVQA 微调反而被人工评估认为更差。
Meta 发布 Llama 3.1 系列,在 Hugging Face Hub 上线 8B、70B、405B 三个规模共 8 个开放权重模型,上下文长度提升至 128K tokens,支持 8 种语言和工具调用。
推荐理由:官方发布说明覆盖了三个规模、内存需求和量化权重,读者可以据此选择适合自己硬件的部署与微调路径。
Hugging Face 发布 Docmatix,一个面向文档视觉问答(DocVQA)的大型数据集,含 240 万张图像和 950 万问答对,来自 130 万份 PDF,规模为此前数据集的 240 倍。
Hugging Face 在 TGI 中推出 Multi-LoRA serving,只部署一次基座模型 mistralai/Mistral-7B-v0.1,即可按请求动态选择 LoRA 适配器,一次部署相当于服务多个微调模型。
推荐理由:原文给出部署步骤、显存开销和成本对比数据,读者可以据此评估一次部署服务多个微调模型是否适合自己的场景。
Hugging Face 发布 SmolLM 小型语言模型系列,提供 135M、360M 和 1.7B 三种参数规模,并同步开源训练语料 SmolLM-Corpus。
推荐理由:官方公开了小型模型的数据配比、训练细节和完整语料,同档评测结果与端侧部署信息都可查证,适合关心小模型训练的人参考。
Hugging Face 团队发布教程,讲解如何用 distilabel 从 Argilla 2.0 技术文档合成三元组数据,微调 BAAI/bge-base-en-v1.5 嵌入模型(结合 TripletLoss 与 MatryoshkaLoss)。
Hugging Face 正在 Dataset Hub 上试验一项新功能,使用开源 PII 检测工具 Presidio 自动生成数据集中个人身份信息(PII)的报告。报告可帮助开发者在训练前评估数据集的 PII 风险,也帮助数据集所有者在发布前验证其 PII 过滤流程。Hugging Face 还感谢法国 CNIL 在 GDPR 合规方面提供的指导。
Hugging Face 为 Dataset Hub 的 Dataset Search 推出四项新功能:按模态(文本、图像、音频、表格等)、按行数大小、按存储格式、按兼容库筛选。行数信息基于文件元数据,元数据缺失时按前 5GB 内容估算。这些筛选可与 Language、Tasks、Licenses 等现有过滤器组合使用。
Hugging Face 伦理与社会通讯第 6 期探讨 AI 数据质量:Reddit 与 Google 的内容合作因 RAG 搜索引擎输出“披萨加胶水”等错误推荐而受挫,说明并非所有数据都同样优质。好数据的关键在于与任务匹配,需具备相关性、全面性、时效性并缓解偏见。文章还阐述高质量数据可提升模型性能、鲁棒性、效率与可复现性,并建议通过去重、内容过滤、人工反馈和数据治理框架来保障质量。
Hugging Face 发布 Florence-2 微调教程。微软 2024 年 6 月发布的 Florence-2 有 0.2B 和 0.7B 两种规模,官方模型不含 VQA 能力。
Hugging Face 与 Argilla 合作的 Data Is Better Together 计划回顾了开源社区共建数据集的进展。
Hugging Face 在 TRL 中推出 RLOO(REINFORCE Leave One-Out)在线 RLHF 训练器,作为 PPO 的替代方案。
Mistral 在 la Plateforme 推出模型定制能力,提供三条路径:开源微调 SDK mistral-finetune(基于 LoRA,可在自有基础设施微调全部开源模型)、平台无服务器微调服务(兼容 Mistral 7B 和 Mistral Small,后续数周将新增模型)以及面向特定客户、支持持续预训练的定制训练服务。
推荐理由:官方同时开放自托管微调 SDK、平台托管服务与定制训练三条路径,读者可据此对比选择适合自己的模型定制方式。
ChatGPT 发布一年多后,OpenAI 阐述了其在 AI 时代的数据处理方法。公司同时推出 Media Manager,供创作者和内容所有者管理自己的内容,并介绍了未来方向。
Hugging Face 团队发布 StarCoder2-15B-Instruct-v0.1,首个采用完全透明、许可开放管线的自对齐代码 LLM,无需人工标注或从专有大模型蒸馏数据。
Meta 发布 Llama 3 开源模型,提供 8B 和 70B 两种规模,各有 base 与 instruct 版本,并附基于 Llama 3 8B 微调的 Llama Guard 2,全部上架 Hugging Face Hub。
推荐理由:官方发布说明完整给出模型规格、许可证变化和部署微调路径,读者可据此评估升级与迁移成本。
OpenAI 为 fine-tuning API 新增多项功能,帮助开发者更精细地控制微调流程,同时宣布扩展自定义模型(custom models)计划的合作方式,为开发者提供更多基于 OpenAI 模型构建定制模型的选择。
Hugging Face 发布 Cosmopedia,一个由 Mixtral-8x7B-Instruct-v0.1 生成的合成数据集,含超 3000 万文件、250 亿 token,旨在复现 Phi-1.5 的训练数据。
推荐理由:官方详解大规模预训练合成数据的构建流程,提示词策划、聚类与去污染方法均可迁移到类似的数据生成项目。
Argilla 与 Hugging Face 发起 Data is better together 实验,几天内吸引 350 位社区贡献者,完成超过 11,000 次提示词评分,并发布含 10,000 条带评分提示词的数据集 10k_prompts_ranked。
Hugging Face 发布 Gemma 模型微调教程,演示用 Transformers、PEFT 与 trl 的 SFTTrainer,通过 LoRA 和 4-bit QLoRA(bitsandbytes、nf4 量化)在 google/gemma-2b 上以 english_quotes 数据集训练模型按指定格式输出名言和作者。
推荐理由:Hugging Face 官方用 LoRA 和 4-bit QLoRA 给出 Gemma 微调的完整可复现代码,覆盖 GPU 和 TPU 两种路径。
Hugging Face 发布教程,展示用 Mixtral-8x7B-Instruct-v0.1 生成合成数据,再通过 AutoTrain 微调 RoBERTa-base 做金融新闻情绪分类。
推荐理由:原文给出可复用的合成数据蒸馏流程和成本对比数字,读者可以照此把自己的分类任务从 LLM API 迁到专用小模型。
Hugging Face 团队在 OpenHermes-2.5-Mistral-7B 和 Zephyr-7b-beta-sft 两个模型上,用 MT-Bench 实测了 DPO、IPO、KTO 三种无需强化学习的偏好对齐方法。
Hugging Face 发布 2023 年开源大语言模型年度回顾,指出开源模型可复现研究、便于社区参与和审查模型偏差,并通过复用 checkpoint 降低碳排放。
Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。
推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。
Intel Labs 与 Hugging Face 推出 SetFitABSA,一个无需提示词的少样本方面级情感分析(ABSA)框架。方法分三步:spaCy 抽取候选方面、SetFit 二分类筛选方面、第二个 SetFit 模型为每个方面标注情感极性;训练数据只需简单的 text/span/label/ordinal 表格格式。
OpenAI 推出数据合作伙伴计划,与组织合作创建用于 AI 训练的开源和私有数据集。该计划旨在让更多领域的深层信息进入模型训练,合作方可选择数据集的开放或私有方式。
Hugging Face 博客用 LoRA 在灾难推文二分类任务上对比 RoBERTa-large、Llama-2-7b 和 Mistral 7B,均在单张 48GB A6000 上微调。
Explosion 上周推出 Prodigy-HF 插件,将 Prodigy 标注工具直接集成 Hugging Face 生态。
Hugging Face 官方博客介绍如何用一行 spotlight.show(ds) 代码,通过 Renumics Spotlight 交互式可视化 datasets 库中的数据集,无需复制或预处理数据。
Hugging Face 发布技术博客,复现 OpenAI 2019 年 RLHF 代码库 openai/lm-human-preferences,在情感和描述性等风格任务上匹配了原始学习曲线,并整理出实现细节清单。
Hugging Face 介绍了如何通过 TRL 库新增的 DDPOTrainer,用强化学习方法 DDPO 微调 Stable Diffusion,使输出更符合人类审美。
OpenAI 宣布与 Scale 合作,为其客户提供 Scale 的 AI 专业能力,帮助企业对 OpenAI 最先进的模型进行微调定制。该合作面向企业客户,通过 Scale 的专业支持完成模型定制。
OpenAI 宣布开发者现在可以使用自有数据对 GPT-3.5 Turbo 进行微调,以适配各自的使用场景,同时带来了相关 API 更新。
Hugging Face 正在用机器学习为 Hub 上缺少语言元数据的数据集检测语言,并由 librarian-bot 自动发起 pull request 补充元数据。
Hugging Face 发布博客,介绍其开源文本生成与大语言模型生态,覆盖 Llama 2 等开源模型、许可证对比、text-generation-inference 服务方案及 PEFT 微调工具。文中列出 Falcon 40B、MPT-30B、XGen、StarCoder 等模型的许可与用途,说明 TGI 已支撑 HuggingChat,并介绍 LoRA 等参数高效微调方法。
Hugging Face 团队调查 Open LLM Leaderboard 上 LLaMA 的 MMLU 分数低于论文报告值的原因,发现同一 MMLU 数据集存在 Original、HELM 和 EleutherAI Harness 三种实现。
Hugging Face 发文回应 AAAI 2023 论文"Transformer 对时间序列预测无效"的说法,指出简单线性模型 DLinear 并不优于 Transformer。