跳到正文

#教程/实践

今日 4 条
11月3日周四
  1. Hugging Face Blog66

    Hugging Face 发布使用 🤗 Transformers 微调 Whisper 的多语言 ASR 实战教程

    Hugging Face 发布分步教程,讲解如何用 🤗 Transformers、Datasets 和 Hub 对 Whisper 做多语言 ASR 微调,涵盖模型原理、Common Voice 数据准备、WhisperProcessor、Seq2SeqTrainer 训练与 WER 评估。

    推荐理由:教程展示了仅用 8 小时 Common Voice 印地语数据微调 Whisper small,把 WER 从 63.5% 降到 32.0%,方法可迁移到其他低资源语言。

10月24日周一
  1. Hugging Face Blog48

    如何用 🤗 Evaluate 评估语言模型偏见

    Hugging Face 在 🤗 Evaluate 库中新增偏见评估指标,用于探究 GPT-2、BLOOM 等因果语言模型(CLM)编码的社会偏见。工作流分两步:用 🤗 Datasets 上的预定义提示词驱动模型生成,再用 Evaluate 的指标评估,涵盖毒性、语言极性、伤害性三类任务。示例中仅改变代词 he/she,GPT-2 补全的女性代词毒性比例为 0.333,男性为 0.0。

10月21日周五
10月14日周五
10月13日周四
10月12日周三
  1. Hugging Face Blog63

    Hugging Face 详解 BLOOM 推理优化历程:延迟降低 5 倍、吞吐提升 50 倍

    Hugging Face 团队发布长文,复盘为 BLOOM(176B 参数、352GB)搭建高效推理服务器的完整过程,最终实现约 5 倍延迟降低(350ms/token 降至 71ms/token)和 50 倍吞吐提升。

    推荐理由:原文复盘了把 BLOOM 推理延迟从 350ms 降到 71ms 的完整优化路径,从 profiling 到自定义 kernel 都有可迁移的方法细节。

9月28日周三
  1. Hugging Face Blog46

    Hugging Face AutoTrain 上线图像分类:零代码训练图像分类模型

    Hugging Face 的零代码机器学习平台 AutoTrain 新增图像分类任务,用户无需写代码即可上传数据训练模型。AutoTrain 会自动尝试多个候选模型,演示项目中 5 个候选模型里最佳者达到 84% 准确率,表现差的会被自动停止以免浪费资源;使用 5 个候选模型和少于 500 张图像训练免费,训练好的模型可在 Hub 上通过 inference widget 直接试用。

9月27日周二
9月16日周五
9月8日周四
9月7日周三
8月24日周三
8月22日周一
  1. Hugging Face Blog85

    Hugging Face 官方教程:用 🧨 Diffusers 使用 Stable Diffusion

    Hugging Face 官方博客发布教程,展示如何用 🧨 Diffusers 库运行 Stable Diffusion v1-4 文生图模型,模型由 CompVis、Stability AI 和 LAION 基于 LAION-5B 子集的 512x512 图像训练。

    推荐理由:官方教程从StableDiffusionPipeline基础用法讲到自定义推理管线,读者可以按步骤复现文生图并理解潜在扩散的三个组件。

8月19日周五
8月18日周四
8月17日周三
  1. Hugging Face Blog74

    Hugging Face 详解 LLM.int8():用 bitsandbytes 实现 8-bit 量化推理

    Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等 176B 参数大模型的推理显存占用减半且性能不下降。

    推荐理由:原文由集成团队讲解 LLM.int8() 的量化原理、零性能下降验证和 transformers 集成细节,读者可据此在有限显存上运行大模型。

8月12日周五
8月11日周四
8月10日周三
8月5日周五
8月2日周二
7月27日周三
7月25日周一
7月22日周五
7月16日周六
  1. Hugging Face Blog31

    如何用对抗性数据动态训练你的模型(以 MNIST 为例)

    Hugging Face 博客讲解动态对抗性数据收集(DADC):让人类构造样本来欺骗 SOTA 模型,再用这些数据多轮迭代训练以提升模型鲁棒性。文章以 MNIST 手写数字识别为例,展示了在 🤗 Spaces 上搭建模型交互 demo、标记(flag)对抗样本并重复训练的完整流程,作者训练的模型 20 epochs 后在测试集达到 89% 准确率。

7月14日周四
7月13日周三
7月7日周四
  1. Hugging Face Blog49

    Hugging Face 教你上手 Twitter 情感分析

    Hugging Face 发布 Twitter 情感分析入门指南,介绍如何用机器学习自动判断推文的正面、负面或中性倾向,用于分析用户反馈和监测品牌提及。有代码基础的读者可用 Tweepy 获取推文并通过 Inference API 做分析,不会编程的用户则可用 Zapier 无代码完成收集、分析和结果写入 Google Sheets 的流程。

6月30日周四
6月29日周三
  1. Hugging Face Blog36

    Hugging Face 新手指南:如何用 Sentence Transformers 启动你的第一个 ML 项目

    Hugging Face 发文介绍机器学习新手如何借助 Sentence Transformers 完成第一个自驱项目。该库可将句子和图像转为嵌入向量,通过 util.cos_sim 余弦相似度比较句子并实现语义搜索,可延伸至聚类、模型蒸馏和 CLIP 文生图,在 GitHub 上已有近 8,000 stars、超过 3,000 个项目依赖它。

6月28日周二
6月23日周四
6月22日周三
6月9日周四
6月7日周二
5月20日周五
5月18日周三
5月4日周三