跳到正文

数据与训练

训练侧的门道:数据集构建、合成数据、预训练与后训练方法、算力与训练成本。

最新精选

第 41–60 条 · 共 66 条
2月16日周五
  1. Hugging Face Blog70

    Hugging Face 教程:用开源 LLM 生成合成数据微调专用模型,节省成本、时间和碳排放

    Hugging Face 发布教程,展示用 Mixtral-8x7B-Instruct-v0.1 生成合成数据,再通过 AutoTrain 微调 RoBERTa-base 做金融新闻情绪分类。

    推荐理由:原文给出可复用的合成数据蒸馏流程和成本对比数字,读者可以照此把自己的分类任务从 LLM API 迁到专用小模型。

12月11日周一
  1. Hugging Face Blog66

    Hugging Face 深入解读 Mixture of Experts(MoE)的原理、训练与推理取舍

    Hugging Face 发布长文系统讲解 MoE(专家混合)架构,以 Mixtral 8x7B 的走红为背景,覆盖稀疏层、路由、负载均衡、Switch Transformers 等核心内容。文章指出 MoE 相同参数量下推理更快、预训练更省算力,但需加载全部参数(Mixtral 8x7B 需按 47B 稠密模型准备显存),且微调更易过拟合,指令微调等新方向有望缓解这一短板。

    推荐理由:这篇解读把 MoE 的结构、路由、负载均衡和微调取舍讲成一条完整脉络,读完能自己判断何时该选稀疏 MoE 而非稠密模型。

6月7日周三
  1. Hugging Face Blog65

    Hugging Face Hub 支持用 DuckDB 以 SQL 查询 5 万多个数据集

    Hugging Face 宣布用户可以在 Hub 上的任何数据集上用 DuckDB 运行 SQL 查询。Dataset Viewer 会自动把所有公开数据集转换为 Parquet 文件,可通过 /parquet 端点获取文件 URL;借助 httpfs 扩展,DuckDB 能直接对远程 Parquet 文件执行 SQL,并支持查询被切分为 500MB 分块的大数据集。

    推荐理由:官方介绍了用 DuckDB 直接对 Hub 上 5 万多数据集跑 SQL 的方法,读者可以照着把 Parquet 端点和查询代码迁移到自己的数据探索流程。

5月9日周二
  1. OpenAI News63

    OpenAI 用 GPT-4 自动解释大语言模型中的神经元并发布 GPT-2 数据集

    OpenAI 使用 GPT-4 自动为大语言模型中神经元的行为撰写解释并进行评分,并发布了涵盖 GPT-2 每个神经元的解释与评分数据集。OpenAI 说明这些解释并不完美。

    推荐理由:OpenAI 用 GPT-4 自动解释并评分 GPT-2 神经元行为并开源数据,为可解释性研究提供了可复用的方法思路。

4月27日周四
  1. Hugging Face Blog61

    Hugging Face 教程:用 TensorFlow 和 TPU 从零训练 RoBERTa 语言模型

    Hugging Face 发布端到端教程,演示用 TensorFlow 和 TPU 在 WikiText (v1) 数据集上从零训练 RoBERTa base 模型,涵盖训练 Unigram tokenizer、生成 TFRecord 分片上传 GCS、以及用 TPUStrategy 进行数据并行训练。

    推荐理由:原文给出从 tokenizer 训练到 TPU 训练的完整流程与代码,读者可据此把 TensorFlow 训练管线迁移到 TPU。

4月5日周三
3月9日周四
  1. Hugging Face Blog70

    Hugging Face 发布 trl 与 peft 集成,在 24GB 消费级 GPU 上用 RLHF 微调 20B 模型

    Hugging Face 官方发布 trl 与 peft 的集成,让用户能以更低成本用强化学习微调大语言模型。通过 8-bit 加载(LLM.int8)、低秩适配器以及用 disable_adapters 复用同一模型获取参考与主动 logits,作者在 24GB NVIDIA 4090 上验证了微调 20B gpt-neox 生成正面影评的完整流程,并指出训练速度和多卡扩展是下一步方向。

    推荐理由:原文给出 trl 与 peft 集成的完整微调流程和显存拆解,读者可以照此在单张 24GB GPU 上复现大模型 RLHF 训练。

2月10日周五
1月24日周二
  1. Hugging Face Blog62

    Hugging Face 解析什么让对话智能体有用:RLHF、IFT、CoT 技术综述

    Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。

    推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。

12月9日周五
  1. Hugging Face Blog64

    Hugging Face 图解 RLHF:用人类反馈强化学习微调语言模型的完整流程

    Hugging Face 发布长文图解 RLHF,将其拆为预训练语言模型、训练奖励模型、用 PPO 微调三个核心步骤。文中说明人类偏好采用排序而非直接打分以降低噪声,奖励函数含 KL 惩罚以防止策略偏离初始模型,并介绍 TRL、TRLX、RL4LMs 等开源工具及代表性论文,同时指出人类标注成本高、标注者分歧等局限。

    推荐理由:这篇官方长文把 RLHF 拆解为预训练、奖励模型和 PPO 微调三步,并梳理开源工具与关键论文,适合建立完整认知。

11月8日周二
9月26日周一
  1. Hugging Face Blog68

    Hugging Face 与 Intel Labs、UKP Lab 发布少样本分类框架 SetFit

    Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个无需提示词的少样本文本分类框架。每类仅需 8 个标注样本即可在 Customer Reviews 数据集上媲美用全量 3k 样本微调的 RoBERTa Large;在 RAFT 基准上 355M 参数的 SetFit 超过 PET 和 GPT-3。

    推荐理由:官方详解 SetFit 的原理、训练成本和 RAFT 实测数据,并附可复现的训练代码,方便直接上手做少样本分类。

6月23日周四
  1. OpenAI News64

    OpenAI 用 Video PreTraining 训练神经网络玩 Minecraft

    OpenAI 发布 VPT(Video PreTraining)方法,利用大规模无标注人类 Minecraft 游玩视频加少量标注承包商数据训练神经网络。经微调后模型可制作钻石工具,该任务熟练人类通常需超过 20 分钟(约 24,000 个操作),模型使用键鼠原生人类接口,被视为迈向通用计算机使用智能体的一步。

    推荐理由:原文介绍了用少量标注数据加大规模无标注视频预训练的思路,对理解视频数据训练智能体方法有参考价值。

1月27日周四
  1. OpenAI News77

    OpenAI 发布 InstructGPT 并设为 API 默认语言模型

    OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究开发、有人类参与闭环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。

    推荐理由:OpenAI 官方说明 InstructGPT 的对齐训练思路及其成为 API 默认模型的变化,可帮读者理解当时模型行为取向的调整。

12月8日周三
7月15日周四
  1. Hugging Face Blog61

    Hugging Face 发布 DeDLOC 协作训练方法并用 40 名志愿者预训练 sahajBERT

    Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 分布式协作训练方法,可自适应参与者的网络与硬件条件。该方法由 40 名志愿者协同预训练了孟加拉语模型 sahajBERT(约 18M 参数,基于 ALBERT),在 NER 上 F1 达 95.45、NCC 准确率 91.97,结果与数百块 V100 训练的 XLM-R-large 相当。

    推荐理由:原文给出 DeDLOC 协作训练方法细节和 40 名志愿者预训练 sahajBERT 的实测结果,含下游任务对比数据,方法可复用。

5月5日周二
  1. OpenAI News69

    OpenAI 分析:ImageNet 分类训练算力需求每 16 个月减半

    OpenAI 发布分析指出,自 2012 年以来在 ImageNet 分类上达到相同性能所需的训练算力每 16 个月减少一半。相比 2012 年,如今训练到 AlexNet 水平所需算力减少 44 倍,而 Moore's Law 同期只能带来 11 倍的成本改善。作者据此认为,在高投入的 AI 任务上,算法进步带来的收益已超过传统硬件效率提升。

    推荐理由:原文量化了算法进步带来的算力节省速度,可与 Moore's Law 对比,帮助理解硬件与算法效率的真实差距。

1月23日周四
12月13日周五
8月20日周二
  1. OpenAI News63

    OpenAI 发布 774M 参数 GPT-2 模型并公开发布规范经验

    OpenAI 在 2 月发布 124M、5 月分阶段发布 355M 之后,发布 774M 参数的 GPT-2 语言模型。同时发布一份开源法律协议,便于机构间建立模型共享合作,并发布技术报告,总结与 AI 研究社区协调发布规范的经验。

    推荐理由:OpenAI 官方复盘分阶段释放 774M GPT-2 的决策过程,可了解滥用风险评估如何影响模型发布策略。