StackLLaMA:用 RLHF 训练 LLaMA 的实战指南
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练教程,演示如何将 LLaMA 7B 微调用于回答 Stack Exchange 问答。
推荐理由:Hugging Face 官方复盘 StackLLaMA 全流程训练细节,包括显存估算、LoRA 配置和 RLHF 训练中的稳定性坑,方法可直接迁移复用。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练教程,演示如何将 LLaMA 7B 微调用于回答 Stack Exchange 问答。
推荐理由:Hugging Face 官方复盘 StackLLaMA 全流程训练细节,包括显存估算、LoRA 配置和 RLHF 训练中的稳定性坑,方法可直接迁移复用。
Hugging Face 阐述其在开放机器学习中的伦理实践:通过逐案分析风险、识别高风险模型,在开放开发与风险控制之间寻求平衡。平台已推出 flagging 举报功能、模型卡文档、“Not For All Audiences” 标签,并推广 RAIL 开放责任许可(如 BLOOM、BigCode),同时基于社区 Spaces 总结出 6 个伦理分类标签。
这是一篇教程,讲解如何用 Flower 框架结合 Hugging Face,在多个客户端上对预训练模型 distilBERT 做联邦微调,完成 IMDB 影评正负情感分类任务。各客户端在本地训练模型并只上传参数,由服务器按预定义策略聚合,无需共享数据。教程还提供可在 Google Colab 中用 flwr['simulation'] 模拟联邦环境的 notebook。
Hugging Face 发布教程,详解如何用 diffusers 训练 ControlNet,并以基于 Microsoft FaceSynthetics 10 万合成人脸数据集训练的 Uncanny Faces 面部姿态模型为例。
推荐理由:作者以亲身训练经历给出从数据集构建到训练参数的完整流程,还分享了过拟合教训和 8GB 显存的降配方法。
Hugging Face Hub 宣布改进 Jupyter notebook(.ipynb)托管支持,新增渲染功能,此前以 JSON 格式存储的 notebook 现在可直接以人类可读格式显示。
Hugging Face 宣布 Informer 模型已在 🤗 Transformers 库中可用,并演示如何用它做多变量概率时间序列预测。
Hugging Face 官方发布 trl 与 peft 的集成,让用户能以更低成本用强化学习微调大语言模型。通过 8-bit 加载(LLM.int8)、低秩适配器以及用 disable_adapters 复用同一模型获取参考与主动 logits,作者在 24GB NVIDIA 4090 上验证了微调 20B gpt-neox 生成正面影评的完整流程,并指出训练速度和多卡扩展是下一步方向。
推荐理由:原文给出 trl 与 peft 集成的完整微调流程和显存拆解,读者可以照此在单张 24GB GPU 上复现大模型 RLHF 训练。
Kakao Brain 与 Hugging Face 发布开源图像文本数据集 COYO-700M,以及基于它训练的 ViT 和 ALIGN 模型,其中 ALIGN 为首个开源版本。
Hugging Face 博客复盘志愿者团队在 2023 年 2 月土耳其地震后开发 afetharita 应用的过程:用 easyocr 加微调 NER 模型从求助推文截图提取姓名、电话和地址,用 bert-base-turkish 系列微调文本分类模型识别庇护、食物、物流等需求,并将地址经地理编码 API 显示在地图上。
Hugging Face 发布 Diffusers for Mac 1.1,这是一款基于 Core ML 的开源原生 Mac 文生图应用,文生图速度最高可提升至两倍。
Hugging Face 宣布与 AWS 扩大长期战略合作,Hugging Face 将 AWS 作为首选云提供商,开发者可通过 Amazon SageMaker、AWS Trainium、AWS Inferentia 等工具在 AWS 上训练、微调和部署模型。双方称此举旨在让生成式 AI 模型更易获取,降低成本,帮助社区将最新研究转化为开放可复现的模型。
Hugging Face 宣布微软亚洲研究院的 SpeechT5 已在 🤗 Transformers 中可用,官方 checkpoint 发布在 Hub 上。
Hugging Face 推出开源工具 AI vs. AI,托管在 Spaces 上,通过持续对战和 ELO 排名(初始分 1200,胜方 +10 / 负方 -10)对多智能体强化学习模型做相对评估。
Hugging Face 过去一年在计算机视觉领域持续投入,Hub 上现已支持 8 个核心视觉任务、超过 3000 个模型和 100 多个数据集,每个任务至少提供 10 个模型检查点。
Hugging Face 宣布 diffusers 正式支持用 LoRA 对 Stable Diffusion 做全量微调和 Dreambooth 训练。
推荐理由:Hugging Face 官方介绍 diffusers 支持 LoRA 微调 Stable Diffusion,给出训练脚本、显存需求和推理加载流程,方法可直接复现。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,通过 Optimum 库的 ORTTrainer API 为 Transformer 模型训练加速,配合 DeepSpeed ZeRO Stage 1 在单台 8 卡 Nvidia A100 节点上测得 39% 到 130% 的加速。
在「AI 做游戏开发」系列第 3 天,作者探讨用 AI 生成 3D 资产,结论是目前 text-to-3D 尚无法实际用于游戏开发。文中盘点 DreamFusion、Point-E、CLIP-Forge、Dream Textures 等最新进展,指出基于 NeRF 的视图合成转出的 mesh 仍需大量后期处理才能 game-ready。
Hugging Face 发文介绍 Mask2Former 和 OneFormer 两个通用图像分割模型现已进入 transformers 库。
Hugging Face 与 PaddlePaddle 达成开源合作,PaddleNLP 将率先接入,其各模态模型库将逐步集成到 Hub 上。
Hugging Face 发布 Model Card Creator 工具、更新版模型卡模板及指南手册,让用户无需编程即可创建模型卡。本次发布还包括标注版模板、Hugging Face 内部用户研究,以及模型文档现状的文献综述。团队未来计划将 Evaluate on the Hub 等工具的自动评估结果导入模型卡工作流。
借助新发布的 Bumblebee 库——纯 Elixir 实现的 Hugging Face Transformers,GPT2 到 Stable Diffusion 等神经网络模型已可在 Elixir 中运行。
Hugging Face 发布长文图解 RLHF,将其拆为预训练语言模型、训练奖励模型、用 PPO 微调三个核心步骤。文中说明人类偏好采用排序而非直接打分以降低噪声,奖励函数含 KL 惩罚以防止策略偏离初始模型,并介绍 TRL、TRLX、RL4LMs 等开源工具及代表性论文,同时指出人类标注成本高、标注者分歧等局限。
推荐理由:这篇官方长文把 RLHF 拆解为预训练、奖励模型和 PPO 微调三步,并梳理开源工具与关键论文,适合建立完整认知。
Hugging Face 发布面向生物学家和机器学习从业者的蛋白质深度学习入门文章,讲解 BERT、GPT 等大语言模型背后的迁移学习原理如何应用于蛋白质研究。文章回顾了 2018 年 ULMFiT 和 BERT 开创预训练范式的过程,并配套提供蛋白质语言模型微调与 ESMFold 蛋白质折叠的示例 notebook(PyTorch 与 TensorFlow 版)。
Hugging Face 宣布启动 2023 年实习计划,开放多个岗位:Open Source 团队的 Accelerate 实习和 Text to Speech 实习。
Hugging Face 联合 Jonathan Whitaker 推出的免费扩散模型课程将于 11 月 28 日发布,并定于 11 月 30 日举办社区直播活动。
Hugging Face 梳理了在其 Hub 上部署模型的多种推理方案:免费试用的 Inference Widget 和 Inference API,以及面向生产环境的 Inference Endpoints 和 Spaces。
Hugging Face 发布 Document AI 长文教程,梳理 OCR、文档图像分类、版面分析、文档解析、表格提取和 DocVQA 六大用例及对应开源模型。文中给出关键基准数字,如 LayoutLMv3 在 RVL-CDIP 达 95% 准确率、DocVQA ANLS 83.37,并提醒 LayoutLMv2/v3 checkpoint 不可商用,附数据准备与建模建议。
Hugging Face 与 arXiv 合作,在 arXivLabs 上集成 Hugging Face Spaces 的 Demos 标签,读者可在论文页面直接找到社区或作者创建的开源 demo。
Hugging Face 宣布对比搜索解码方法进入 transformers 4.24.0,支持 PyTorch 和 TensorFlow,并附 Colab 与在线对比演示。
推荐理由:原文用 GPT-2 和 OPT 的实例对比贪心、nucleus 采样与对比搜索的输出质量,并给出可复用的代码参数。
Hugging Face 发布分步教程,讲解如何用 🤗 Transformers、Datasets 和 Hub 对 Whisper 做多语言 ASR 微调,涵盖模型原理、Common Voice 数据准备、WhisperProcessor、Seq2SeqTrainer 训练与 WER 评估。
推荐理由:教程展示了仅用 8 小时 Common Voice 印地语数据微调 Whisper small,把 WER 从 63.5% 降到 32.0%,方法可迁移到其他低资源语言。
Hugging Face 在 🤗 Evaluate 库中新增偏见评估指标,用于探究 GPT-2、BLOOM 等因果语言模型(CLM)编码的社会偏见。工作流分两步:用 🤗 Datasets 上的预定义提示词驱动模型生成,再用 Evaluate 的指标评估,涵盖毒性、语言极性、伤害性三类任务。示例中仅改变代词 he/she,GPT-2 补全的女性代词毒性比例为 0.333,男性为 0.0。
Hugging Face 发布 MTEB(Massive Text Embedding Benchmark),用于衡量文本嵌入模型在多种任务上的表现,排行榜已汇总超过 2000 个结果。
Diffusers 自 0.5.1 起支持 Flax,官方教程演示如何在 Google TPU 上用 FlaxStableDiffusionPipeline 运行 CompVis/stable-diffusion-v1-4 推理。
Hugging Face Hub 正式支持为模型或数据集生成 DOI(数字对象标识符),用户可在仓库设置中直接生成,他人通过页面上的“Cite this model/dataset”按钮引用。DOI 由 Hugging Face 与 DataCite 合作提供,绑定元数据并生成永久链接;模型或数据集发布新版本时可更新 DOI,旧版 DOI 随之失效。
rinna 基于 Stable Diffusion 微调出日语文生图模型 Japanese Stable Diffusion,接受日语提示词并生成反映日语圈文化的图像。
Hugging Face 的 Evaluation on the Hub 功能升级,任何 Hub 上的 causal language model 现在都能免代码进行零样本分类评估,由 AutoTrain 驱动且免费。
Hugging Face 官方详解 Accelerate 如何在普通硬件上加载并运行超大模型,示例可在免费 Colab 上运行 OPT-6.7B。
推荐理由:官方详解 Accelerate 借助 PyTorch meta device、分片加载与 hooks 实现超大模型推理的完整原理,方法可直接复用。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个无需提示词的少样本文本分类框架。每类仅需 8 个标注样本即可在 Customer Reviews 数据集上媲美用全量 3k 样本微调的 RoBERTa Large;在 RAFT 基准上 355M 参数的 SetFit 超过 PET 和 GPT-3。
推荐理由:官方详解 SetFit 的原理、训练成本和 RAFT 实测数据,并附可复现的训练代码,方便直接上手做少样本分类。
Hugging Face 推出 Ethics and Society Newsletter,由公司内跨团队的"Ethics and Society regulars"开放小组编写,计划每季度在春分、夏至、秋分、冬至发布。
OpenAI 宣布训练并开源名为 Whisper 的神经网络,该模型在英文语音识别上的鲁棒性和准确率接近人类水平。
推荐理由:OpenAI 官方宣布开源 Whisper,读者可以据此了解其在英文语音识别上的准确性与鲁棒性水平。