跳到正文

#数据/训练

今日 0 条
6月12日周一
6月7日周三
  1. Hugging Face Blog65

    Hugging Face Hub 支持用 DuckDB 以 SQL 查询 5 万多个数据集

    Hugging Face 宣布用户可以在 Hub 上的任何数据集上用 DuckDB 运行 SQL 查询。Dataset Viewer 会自动把所有公开数据集转换为 Parquet 文件,可通过 /parquet 端点获取文件 URL;借助 httpfs 扩展,DuckDB 能直接对远程 Parquet 文件执行 SQL,并支持查询被切分为 500MB 分块的大数据集。

    推荐理由:官方介绍了用 DuckDB 直接对 Hub 上 5 万多数据集跑 SQL 的方法,读者可以照着把 Parquet 端点和查询代码迁移到自己的数据探索流程。

5月16日周二
5月9日周二
  1. OpenAI News63

    OpenAI 用 GPT-4 自动解释大语言模型中的神经元并发布 GPT-2 数据集

    OpenAI 使用 GPT-4 自动为大语言模型中神经元的行为撰写解释并进行评分,并发布了涵盖 GPT-2 每个神经元的解释与评分数据集。OpenAI 说明这些解释并不完美。

    推荐理由:OpenAI 用 GPT-4 自动解释并评分 GPT-2 神经元行为并开源数据,为可解释性研究提供了可复用的方法思路。

4月27日周四
  1. Hugging Face Blog61

    Hugging Face 教程:用 TensorFlow 和 TPU 从零训练 RoBERTa 语言模型

    Hugging Face 发布端到端教程,演示用 TensorFlow 和 TPU 在 WikiText (v1) 数据集上从零训练 RoBERTa base 模型,涵盖训练 Unigram tokenizer、生成 TFRecord 分片上传 GCS、以及用 TPUStrategy 进行数据并行训练。

    推荐理由:原文给出从 tokenizer 训练到 TPU 训练的完整流程与代码,读者可据此把 TensorFlow 训练管线迁移到 TPU。

4月26日周三
4月12日周三
  1. Hugging Face Blog26

    Hugging Face 携手 Substra 打造隐私保护 AI:联邦学习入门 Space

    Hugging Face 与开源联邦学习框架 Substra 合作创建了一个 Space,演示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重,多来源数据训练的模型在验证数据上几乎总优于单一来源模型。Substra 已在乳腺癌研究等真实场景落地,并曾支撑 MELLODDY 项目中 10 家药企共享全球最大的小分子活性数据集。

4月5日周三
3月9日周四
  1. Hugging Face Blog70

    Hugging Face 发布 trl 与 peft 集成,在 24GB 消费级 GPU 上用 RLHF 微调 20B 模型

    Hugging Face 官方发布 trl 与 peft 的集成,让用户能以更低成本用强化学习微调大语言模型。通过 8-bit 加载(LLM.int8)、低秩适配器以及用 disable_adapters 复用同一模型获取参考与主动 logits,作者在 24GB NVIDIA 4090 上验证了微调 20B gpt-neox 生成正面影评的完整流程,并指出训练速度和多卡扩展是下一步方向。

    推荐理由:原文给出 trl 与 peft 集成的完整微调流程和显存拆解,读者可以照此在单张 24GB GPU 上复现大模型 RLHF 训练。

3月3日周五
2月10日周五
1月24日周二
  1. Hugging Face Blog62

    Hugging Face 解析什么让对话智能体有用:RLHF、IFT、CoT 技术综述

    Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。

    推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。

12月15日周四
  1. Hugging Face Blog45

    聊聊机器学习中的偏见:Hugging Face 伦理与社会通讯 #2

    Hugging Face 伦理与社会团队发文探讨机器学习中的偏见问题,指出 ML 模型作为社会技术系统会放大会加剧不公的社会趋势,且随部署环境不断演变,任何单一技术手段都难以解决。文章分享了在任务定义、数据集构建和模型训练各阶段应对偏见的经验,并介绍了团队开发的相关分析工具。

12月9日周五
  1. Hugging Face Blog64

    Hugging Face 图解 RLHF:用人类反馈强化学习微调语言模型的完整流程

    Hugging Face 发布长文图解 RLHF,将其拆为预训练语言模型、训练奖励模型、用 PPO 微调三个核心步骤。文中说明人类偏好采用排序而非直接打分以降低噪声,奖励函数含 KL 惩罚以防止策略偏离初始模型,并介绍 TRL、TRLX、RL4LMs 等开源工具及代表性论文,同时指出人类标注成本高、标注者分歧等局限。

    推荐理由:这篇官方长文把 RLHF 拆解为预训练、奖励模型和 PPO 微调三步,并梳理开源工具与关键论文,适合建立完整认知。

11月8日周二
10月21日周五
9月26日周一
  1. Hugging Face Blog68

    Hugging Face 与 Intel Labs、UKP Lab 发布少样本分类框架 SetFit

    Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个无需提示词的少样本文本分类框架。每类仅需 8 个标注样本即可在 Customer Reviews 数据集上媲美用全量 3k 样本微调的 RoBERTa Large;在 RAFT 基准上 355M 参数的 SetFit 超过 PET 和 GPT-3。

    推荐理由:官方详解 SetFit 的原理、训练成本和 RAFT 实测数据,并附可复现的训练代码,方便直接上手做少样本分类。

9月7日周三
8月22日周一
8月12日周五
8月2日周二
7月28日周四
7月22日周五
7月16日周六
  1. Hugging Face Blog31

    如何用对抗性数据动态训练你的模型(以 MNIST 为例)

    Hugging Face 博客讲解动态对抗性数据收集(DADC):让人类构造样本来欺骗 SOTA 模型,再用这些数据多轮迭代训练以提升模型鲁棒性。文章以 MNIST 手写数字识别为例,展示了在 🤗 Spaces 上搭建模型交互 demo、标记(flag)对抗样本并重复训练的完整流程,作者训练的模型 20 epochs 后在测试集达到 89% 准确率。

7月14日周四
6月30日周四
6月23日周四
  1. OpenAI News64

    OpenAI 用 Video PreTraining 训练神经网络玩 Minecraft

    OpenAI 发布 VPT(Video PreTraining)方法,利用大规模无标注人类 Minecraft 游玩视频加少量标注承包商数据训练神经网络。经微调后模型可制作钻石工具,该任务熟练人类通常需超过 20 分钟(约 24,000 个操作),模型使用键鼠原生人类接口,被视为迈向通用计算机使用智能体的一步。

    推荐理由:原文介绍了用少量标注数据加大规模无标注视频预训练的思路,对理解视频数据训练智能体方法有参考价值。

6月9日周四
6月7日周二
5月23日周一
5月17日周二
5月2日周一
4月28日周四
4月26日周二
4月25日周一
1月27日周四
  1. OpenAI News77

    OpenAI 发布 InstructGPT 并设为 API 默认语言模型

    OpenAI 训练出比 GPT-3 更能遵循用户意图、同时更真实且毒性更低的 InstructGPT 模型,采用其对齐研究开发、有人类参与闭环的训练技术。这些模型现已部署为 OpenAI API 的默认语言模型。

    推荐理由:OpenAI 官方说明 InstructGPT 的对齐训练思路及其成为 API 默认模型的变化,可帮读者理解当时模型行为取向的调整。

12月23日周四
12月14日周二
12月8日周三