跳到正文

#数据/训练

今日 2 条
4月12日周三
  1. Hugging Face Blog26

    Hugging Face 携手 Substra 打造隐私保护 AI:联邦学习入门 Space

    Hugging Face 与开源联邦学习框架 Substra 合作创建了一个 Space,演示如何在数据不出本地的前提下训练模型。联邦学习只传输模型权重,多来源数据训练的模型在验证数据上几乎总优于单一来源模型。Substra 已在乳腺癌研究等真实场景落地,并曾支撑 MELLODDY 项目中 10 家药企共享全球最大的小分子活性数据集。

4月5日周三
3月9日周四
  1. Hugging Face Blog70

    Hugging Face 发布 trl 与 peft 集成,在 24GB 消费级 GPU 上用 RLHF 微调 20B 模型

    Hugging Face 官方发布 trl 与 peft 的集成,让用户能以更低成本用强化学习微调大语言模型。通过 8-bit 加载(LLM.int8)、低秩适配器以及用 disable_adapters 复用同一模型获取参考与主动 logits,作者在 24GB NVIDIA 4090 上验证了微调 20B gpt-neox 生成正面影评的完整流程,并指出训练速度和多卡扩展是下一步方向。

    推荐理由:原文给出 trl 与 peft 集成的完整微调流程和显存拆解,读者可以照此在单张 24GB GPU 上复现大模型 RLHF 训练。

3月3日周五
1月24日周二
  1. Hugging Face Blog62

    Hugging Face 解析什么让对话智能体有用:RLHF、IFT、CoT 技术综述

    Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。

    推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。

12月15日周四
  1. Hugging Face Blog45

    聊聊机器学习中的偏见:Hugging Face 伦理与社会通讯 #2

    Hugging Face 伦理与社会团队发文探讨机器学习中的偏见问题,指出 ML 模型作为社会技术系统会放大会加剧不公的社会趋势,且随部署环境不断演变,任何单一技术手段都难以解决。文章分享了在任务定义、数据集构建和模型训练各阶段应对偏见的经验,并介绍了团队开发的相关分析工具。

12月9日周五
  1. Hugging Face Blog64

    Hugging Face 图解 RLHF:用人类反馈强化学习微调语言模型的完整流程

    Hugging Face 发布长文图解 RLHF,将其拆为预训练语言模型、训练奖励模型、用 PPO 微调三个核心步骤。文中说明人类偏好采用排序而非直接打分以降低噪声,奖励函数含 KL 惩罚以防止策略偏离初始模型,并介绍 TRL、TRLX、RL4LMs 等开源工具及代表性论文,同时指出人类标注成本高、标注者分歧等局限。

    推荐理由:这篇官方长文把 RLHF 拆解为预训练、奖励模型和 PPO 微调三步,并梳理开源工具与关键论文,适合建立完整认知。

11月8日周二
10月21日周五
9月26日周一
  1. Hugging Face Blog68

    Hugging Face 与 Intel Labs、UKP Lab 发布少样本分类框架 SetFit

    Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个无需提示词的少样本文本分类框架。每类仅需 8 个标注样本即可在 Customer Reviews 数据集上媲美用全量 3k 样本微调的 RoBERTa Large;在 RAFT 基准上 355M 参数的 SetFit 超过 PET 和 GPT-3。

    推荐理由:官方详解 SetFit 的原理、训练成本和 RAFT 实测数据,并附可复现的训练代码,方便直接上手做少样本分类。

9月7日周三
8月22日周一
8月12日周五
8月2日周二
7月28日周四
7月22日周五
7月16日周六
  1. Hugging Face Blog31

    如何用对抗性数据动态训练你的模型(以 MNIST 为例)

    Hugging Face 博客讲解动态对抗性数据收集(DADC):让人类构造样本来欺骗 SOTA 模型,再用这些数据多轮迭代训练以提升模型鲁棒性。文章以 MNIST 手写数字识别为例,展示了在 🤗 Spaces 上搭建模型交互 demo、标记(flag)对抗样本并重复训练的完整流程,作者训练的模型 20 epochs 后在测试集达到 89% 准确率。

7月14日周四
6月30日周四
6月9日周四
6月7日周二
5月23日周一
5月17日周二
5月2日周一
4月28日周四
4月26日周二
4月25日周一
12月23日周四
12月14日周二
12月8日周三
11月29日周一
11月19日周五
10月26日周二
9月23日周四
7月15日周四
  1. Hugging Face Blog61

    Hugging Face 发布 DeDLOC 协作训练方法并用 40 名志愿者预训练 sahajBERT

    Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 分布式协作训练方法,可自适应参与者的网络与硬件条件。该方法由 40 名志愿者协同预训练了孟加拉语模型 sahajBERT(约 18M 参数,基于 ALBERT),在 NER 上 F1 达 95.45、NCC 准确率 91.97,结果与数百块 V100 训练的 XLM-R-large 相当。

    推荐理由:原文给出 DeDLOC 协作训练方法细节和 40 名志愿者预训练 sahajBERT 的实测结果,含下游任务对比数据,方法可复用。

4月8日周四
3月31日周三
  1. Hugging Face Blog45

    理解 BigBird 的块稀疏注意力

    BigBird 用块稀疏注意力替代 BERT 的全注意力,可处理最长 4096 的序列,计算成本远低于 BERT,其 RoBERTa 类模型已在 🤗Transformers 中可用。其注意力由三部分近似:捕获邻近依赖的滑动注意力、被所有 token 关注的全局 token,以及随机选择的随机 token,以此在长序列上高效逼近全注意力。该模型在长文档摘要、长上下文问答等任务上取得 SOTA。

3月9日周二
2月25日周四