Hugging Face 将 StarCoder 微调为 StarChat 编程助手并开源全流程
Hugging Face 团队将 BigCode 的 StarCoder(16B 参数、8,192 token 上下文)微调为编程助手 StarChat alpha。
推荐理由:原文完整展示了用 OpenAssistant 对话数据和 DeepSpeed ZeRO-3 将 StarCoder 微调为编程助手的可复现流程,并附评估方法。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
Hugging Face 团队将 BigCode 的 StarCoder(16B 参数、8,192 token 上下文)微调为编程助手 StarChat alpha。
推荐理由:原文完整展示了用 OpenAssistant 对话数据和 DeepSpeed ZeRO-3 将 StarCoder 微调为编程助手的可复现流程,并附评估方法。
Hugging Face 发布博客,梳理文本生成视频模型从 GAN、Transformer 到扩散模型的演进脉络,并对比文本生成图像任务解释其在计算成本、数据集和视频描述上的挑战。
推荐理由:系统梳理了文本生成视频模型的技术演进、数据集挑战与代表工作,并给出 Diffusers 上的可复用代码与演示入口。
BigCode(由 Hugging Face 与 ServiceNow 联合主导)发布约 15B 参数的代码大模型 StarCoder 和 StarCoderBase,在 1 万亿 token 上训练,覆盖 80+ 编程语言。
推荐理由:官方发布且附完整评测数据,读者可以据此对比开源代码模型与闭源模型的实际差距。
Hugging Face 发布端到端教程,演示用 TensorFlow 和 TPU 在 WikiText (v1) 数据集上从零训练 RoBERTa base 模型,涵盖训练 Unigram tokenizer、生成 TFRecord 分片上传 GCS、以及用 TPUStrategy 进行数据并行训练。
推荐理由:原文给出从 tokenizer 训练到 TPU 训练的完整流程与代码,读者可据此把 TensorFlow 训练管线迁移到 TPU。
Hugging Face 官方博客演示用 🧨 diffusers 在免费版 Google Colab(13GB CPU 内存、T4 15GB 显存)上运行 DeepFloyd 的开源文生图模型 IF,并支持图像变化和局部重绘。
推荐理由:官方博客给出在 13GB 内存免费 Colab 上跑通 40GB 参数 IF 的完整低显存方案,含可复用的代码和量化技巧。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练教程,演示如何将 LLaMA 7B 微调用于回答 Stack Exchange 问答。
推荐理由:Hugging Face 官方复盘 StackLLaMA 全流程训练细节,包括显存估算、LoRA 配置和 RLHF 训练中的稳定性坑,方法可直接迁移复用。
Hugging Face 发布教程,详解如何用 diffusers 训练 ControlNet,并以基于 Microsoft FaceSynthetics 10 万合成人脸数据集训练的 Uncanny Faces 面部姿态模型为例。
推荐理由:作者以亲身训练经历给出从数据集构建到训练参数的完整流程,还分享了过拟合教训和 8GB 显存的降配方法。
Hugging Face 官方发布 trl 与 peft 的集成,让用户能以更低成本用强化学习微调大语言模型。通过 8-bit 加载(LLM.int8)、低秩适配器以及用 disable_adapters 复用同一模型获取参考与主动 logits,作者在 24GB NVIDIA 4090 上验证了微调 20B gpt-neox 生成正面影评的完整流程,并指出训练速度和多卡扩展是下一步方向。
推荐理由:原文给出 trl 与 peft 集成的完整微调流程和显存拆解,读者可以照此在单张 24GB GPU 上复现大模型 RLHF 训练。
Hugging Face 发布教程,介绍如何在 Diffusers 中通过 StableDiffusionControlNetPipeline 使用 ControlNet,支持 canny 边缘、OpenPose 姿态等 8 种空间条件控制 Stable Diffusion 生成,并可组合多个条件或与 DreamBooth 微调结合。
推荐理由:原文给出 ControlNet 在 Diffusers 中的完整用法和加速省显存配置,读者可以照搬代码在 Colab 上复现同样的生成效果。
Hugging Face 发布教程,介绍 Salesforce Research 的 BLIP-2 模型已登陆 Transformers 库,并演示零样本图像描述、提示式图像描述、视觉问答和对话式提示四类用法。
推荐理由:文章拆解了 BLIP-2 的 Q-Former 架构和两阶段预训练方法,并给出在 Transformers 中跑通图生文、VQA 和对话提示的完整代码。
Hugging Face 发布 🤗 PEFT 库,集成于 Transformers 与 Accelerate,支持 LoRA、Prefix Tuning、P-Tuning、Prompt Tuning 等参数高效微调方法。
推荐理由:官方介绍 PEFT 库的原理与用法,读者可以据此了解只用少量可训练参数微调大模型的可行路径。
Hugging Face 宣布 diffusers 正式支持用 LoRA 对 Stable Diffusion 做全量微调和 Dreambooth 训练。
推荐理由:Hugging Face 官方介绍 diffusers 支持 LoRA 微调 Stable Diffusion,给出训练脚本、显存需求和推理加载流程,方法可直接复现。
Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。
推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。
Hugging Face 发布教程,介绍如何用 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群在 AWS 上加速 PyTorch 训练。
推荐理由:原文给出在 Intel Sapphire Rapids CPU 集群上做分布式训练的完整步骤和实测数据,读者可以照搬这套方法。
Hugging Face 发布教程,讲解如何用 🤗 transformers 运行零样本分割模型 CLIPSeg。
推荐理由:教程讲清了 CLIPSeg 的零样本分割原理、文本与图像两种提示用法及低分辨率局限,并给出在 Segments.ai 上精修标注的完整流程。
Hugging Face 联合 Apple 将 Stable Diffusion 权重转换为 Core ML 格式并上传 Hub,支持 v1.4、v1.5、v2 base 和 v2.1 base,可在 Apple Silicon 的 CPU、GPU 和 Neural Engine 上运行。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的转换与推理方法,包括 Python 和 Swift 两条路径及性能变体选择,可迁移到自己的工作流。
Hugging Face 宣布对比搜索解码方法进入 transformers 4.24.0,支持 PyTorch 和 TensorFlow,并附 Colab 与在线对比演示。
推荐理由:原文用 GPT-2 和 OPT 的实例对比贪心、nucleus 采样与对比搜索的输出质量,并给出可复用的代码参数。
Hugging Face 基于大量实验讲解如何用 🧨 Diffusers 的 train_dreambooth.py 微调 Stable Diffusion,并给出推荐设置:低学习率配合逐步增加步数,人脸训练约需 800-1200 步(batch size 2、LR 1e-6),训练人脸时应使用 prior preservation 防止过拟合。
推荐理由:Hugging Face 用多组实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数、先验保留等关键超参建议,可直接照做。
Hugging Face 发布分步教程,讲解如何用 🤗 Transformers、Datasets 和 Hub 对 Whisper 做多语言 ASR 微调,涵盖模型原理、Common Voice 数据准备、WhisperProcessor、Seq2SeqTrainer 训练与 WER 评估。
推荐理由:教程展示了仅用 8 小时 Common Voice 印地语数据微调 Whisper small,把 WER 从 63.5% 降到 32.0%,方法可迁移到其他低资源语言。
Hugging Face 团队发布长文,复盘为 BLOOM(176B 参数、352GB)搭建高效推理服务器的完整过程,最终实现约 5 倍延迟降低(350ms/token 降至 71ms/token)和 50 倍吞吐提升。
推荐理由:原文复盘了把 BLOOM 推理延迟从 350ms 降到 71ms 的完整优化路径,从 profiling 到自定义 kernel 都有可迁移的方法细节。