跳到正文

#Hugging Face

今日 0 条
7月15日周四
  1. Hugging Face Blog61

    Hugging Face 发布 DeDLOC 协作训练方法并用 40 名志愿者预训练 sahajBERT

    Hugging Face 联合 Yandex Research 等机构提出 DeDLOC 分布式协作训练方法,可自适应参与者的网络与硬件条件。该方法由 40 名志愿者协同预训练了孟加拉语模型 sahajBERT(约 18M 参数,基于 ALBERT),在 NER 上 F1 达 95.45、NCC 准确率 91.97,结果与数百块 V100 训练的 XLM-R-large 相当。

    推荐理由:原文给出 DeDLOC 协作训练方法细节和 40 名志愿者预训练 sahajBERT 的实测结果,含下游任务对比数据,方法可复用。

7月13日周二
7月8日周四
6月28日周一
6月3日周四
5月25日周二
4月20日周二
4月16日周五
  1. Hugging Face Blog61

    Hugging Face 发布 Accelerate 库,五行代码让 PyTorch 训练脚本适配任意分布式设备

    Hugging Face 发布开源库 Accelerate,用户只需在标准 PyTorch 训练脚本中添加约五行代码,即可在多 GPU、TPU、混合精度等任意分布式环境下运行,且保留对训练循环的完全控制。

    推荐理由:原文给出在标准 PyTorch 脚本上加约五行代码即可迁移多 GPU、TPU 和混合精度的具体做法,可与手写 DistributedDataParallel 对比参考。

4月8日周四
3月31日周三
  1. Hugging Face Blog45

    理解 BigBird 的块稀疏注意力

    BigBird 用块稀疏注意力替代 BERT 的全注意力,可处理最长 4096 的序列,计算成本远低于 BERT,其 RoBERTa 类模型已在 🤗Transformers 中可用。其注意力由三部分近似:捕获邻近依赖的滑动注意力、被所有 token 关注的全局 token,以及随机选择的随机 token,以此在长序列上高效逼近全注意力。该模型在长文档摘要、长上下文问答等任务上取得 SOTA。

3月23日周二
3月18日周四
3月12日周五
3月9日周二
2月25日周四
2月10日周三
2月9日周二
1月26日周二
1月19日周二
1月18日周一
11月9日周一
11月3日周二
11月2日周一
10月10日周六
  1. Hugging Face Blog51

    Hugging Face 详解基于 Transformer 的编码器-解码器模型

    Hugging Face 发布长文教程,详解基于 Transformer 的编码器-解码器架构如何建模序列到序列任务。文章从 RNN 编码器-解码器模型的历史讲起,分解编码器的双向自注意力与解码器的单向自注意力和交叉注意力机制,并以 MarianMT 模型代码演示 .generate() 自回归推理,涵盖 T5、Bart、Pegasus 等模型背景,但不涉及训练方法。

9月10日周四
7月3日周五
3月1日周日
2月14日周五