Hugging Face 教程:用开源 LLM 生成合成数据微调专用模型,节省成本、时间和碳排放
Hugging Face 发布教程,展示用 Mixtral-8x7B-Instruct-v0.1 生成合成数据,再通过 AutoTrain 微调 RoBERTa-base 做金融新闻情绪分类。
推荐理由:原文给出可复用的合成数据蒸馏流程和成本对比数字,读者可以照此把自己的分类任务从 LLM API 迁到专用小模型。
训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。
Hugging Face 发布教程,展示用 Mixtral-8x7B-Instruct-v0.1 生成合成数据,再通过 AutoTrain 微调 RoBERTa-base 做金融新闻情绪分类。
推荐理由:原文给出可复用的合成数据蒸馏流程和成本对比数字,读者可以照此把自己的分类任务从 LLM API 迁到专用小模型。
Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。
推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。
Hugging Face 宣布用户可以在 Hub 上的任何数据集上用 DuckDB 运行 SQL 查询。Dataset Viewer 会自动把所有公开数据集转换为 Parquet 文件,可通过 /parquet 端点获取文件 URL;借助 httpfs 扩展,DuckDB 能直接对远程 Parquet 文件执行 SQL,并支持查询被切分为 500MB 分块的大数据集。
推荐理由:官方介绍了用 DuckDB 直接对 Hub 上 5 万多数据集跑 SQL 的方法,读者可以照着把 Parquet 端点和查询代码迁移到自己的数据探索流程。
OpenAI 使用 GPT-4 自动为大语言模型中神经元的行为撰写解释并进行评分,并发布了涵盖 GPT-2 每个神经元的解释与评分数据集。OpenAI 说明这些解释并不完美。
推荐理由:OpenAI 用 GPT-4 自动解释并评分 GPT-2 神经元行为并开源数据,为可解释性研究提供了可复用的方法思路。
Hugging Face 发布端到端教程,演示用 TensorFlow 和 TPU 在 WikiText (v1) 数据集上从零训练 RoBERTa base 模型,涵盖训练 Unigram tokenizer、生成 TFRecord 分片上传 GCS、以及用 TPUStrategy 进行数据并行训练。
推荐理由:原文给出从 tokenizer 训练到 TPU 训练的完整流程与代码,读者可据此把 TensorFlow 训练管线迁移到 TPU。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练教程,演示如何将 LLaMA 7B 微调用于回答 Stack Exchange 问答。
推荐理由:Hugging Face 官方复盘 StackLLaMA 全流程训练细节,包括显存估算、LoRA 配置和 RLHF 训练中的稳定性坑,方法可直接迁移复用。
Hugging Face 官方发布 trl 与 peft 的集成,让用户能以更低成本用强化学习微调大语言模型。通过 8-bit 加载(LLM.int8)、低秩适配器以及用 disable_adapters 复用同一模型获取参考与主动 logits,作者在 24GB NVIDIA 4090 上验证了微调 20B gpt-neox 生成正面影评的完整流程,并指出训练速度和多卡扩展是下一步方向。
推荐理由:原文给出 trl 与 peft 集成的完整微调流程和显存拆解,读者可以照此在单张 24GB GPU 上复现大模型 RLHF 训练。
Hugging Face 发布 🤗 PEFT 库,集成于 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、P-Tuning、Prompt Tuning 等参数高效微调方法。
推荐理由:官方介绍 PEFT 库的原理与用法,读者可以据此了解只用少量可训练参数微调大模型的可行路径。
Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。
推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。
Hugging Face 发布长文图解 RLHF,将其拆为预训练语言模型、训练奖励模型、用 PPO 微调三个核心步骤。文中说明人类偏好采用排序而非直接打分以降低噪声,奖励函数含 KL 惩罚以防止策略偏离初始模型,并介绍 TRL、TRLX、RL4LMs 等开源工具及代表性论文,同时指出人类标注成本高、标注者分歧等局限。
推荐理由:这篇官方长文把 RLHF 拆解为预训练、奖励模型和 PPO 微调三步,并梳理开源工具与关键论文,适合建立完整认知。
Hugging Face 宣布对比搜索解码方法进入 transformers 4.24.0,支持 PyTorch 和 TensorFlow,并附 Colab 与在线对比演示。
推荐理由:原文用 GPT-2 和 OPT 的实例对比贪心、nucleus 采样与对比搜索的输出质量,并给出可复用的代码参数。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个无需提示词的少样本文本分类框架。每类仅需 8 个标注样本即可在 Customer Reviews 数据集上媲美用全量 3k 样本微调的 RoBERTa Large;在 RAFT 基准上 355M 参数的 SetFit 超过 PET 和 GPT-3。
推荐理由:官方详解 SetFit 的原理、训练成本和 RAFT 实测数据,并附可复现的训练代码,方便直接上手做少样本分类。
OpenAI 发布 VPT(Video PreTraining)方法,利用大规模无标注人类 Minecraft 游玩视频加少量标注承包商数据训练神经网络。经微调后模型可制作钻石工具,该任务熟练人类通常需超过 20 分钟(约 24,000 个操作),模型使用键鼠原生人类接口,被视为迈向通用计算机使用智能体的一步。
推荐理由:原文介绍了用少量标注数据加大规模无标注视频预训练的思路,对理解视频数据训练智能体方法有参考价值。
OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究开发、有人类参与闭环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。
推荐理由:OpenAI 官方说明 InstructGPT 的对齐训练思路及其成为 API 默认模型的变化,可帮读者理解当时模型行为取向的调整。
Hugging Face 发布教程,展示如何从零训练名为 CodeParrot 的 GPT-2 代码生成模型。
推荐理由:原文从数据清洗到训练和评测完整走一遍预训练流程,方法步骤可迁移到读者自己的代码模型训练。
Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 分布式协作训练方法,可自适应参与者的网络与硬件条件。该方法由 40 名志愿者协同预训练了孟加拉语模型 sahajBERT(约 18M 参数,基于 ALBERT),在 NER 上 F1 达 95.45、NCC 准确率 91.97,结果与数百块 V100 训练的 XLM-R-large 相当。
推荐理由:原文给出 DeDLOC 协作训练方法细节和 40 名志愿者预训练 sahajBERT 的实测结果,含下游任务对比数据,方法可复用。
OpenAI 发布分析指出,自 2012 年以来在 ImageNet 分类上达到相同性能所需的训练算力每 16 个月减少一半。相比 2012 年,如今训练到 AlexNet 水平所需算力减少 44 倍,而 Moore's Law 同期只能带来 11 倍的成本改善。作者据此认为,在高投入的 AI 任务上,算法进步带来的收益已超过传统硬件效率提升。
推荐理由:原文量化了算法进步带来的算力节省速度,可与 Moore's Law 对比,帮助理解硬件与算法效率的真实差距。
OpenAI 发表关于神经语言模型缩放定律的研究,原文正文抓取失败,仅标题可用。
OpenAI 发布关于 Dota 2 大规模深度强化学习的文章。材料抓取失败,仅标题可用,正文细节无法确认。
OpenAI 在 2 月发布 124M、5 月分阶段发布 355M 之后,发布 774M 参数的 GPT-2 语言模型。同时发布一份开源法律协议,便于机构间建立模型共享合作,并发布技术报告,总结与 AI 研究社区协调发布规范的经验。
推荐理由:OpenAI 官方复盘分阶段释放 774M GPT-2 的决策过程,可了解滥用风险评估如何影响模型发布策略。