用 Transformers.js 制作浏览器端 ML 网页游戏 Doodle Dash
作者发布了教程,讲解如何用 Transformers.js 制作完全在浏览器中实时运行的 ML 网页游戏 Doodle Dash,灵感来自 Google 的 Quick, Draw!
推荐理由:原文给出了从微调 apple/mobilevit-small 到用 Transformers.js 在浏览器端实时推理的完整流程,方法可直接复用于自制浏览器端 ML 游戏。
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
作者发布了教程,讲解如何用 Transformers.js 制作完全在浏览器中实时运行的 ML 网页游戏 Doodle Dash,灵感来自 Google 的 Quick, Draw!
推荐理由:原文给出了从微调 apple/mobilevit-small 到用 Transformers.js 在浏览器端实时推理的完整流程,方法可直接复用于自制浏览器端 ML 游戏。
Hugging Face 发布教程,展示用 Node.js 搭建文本到网页应用的生成器,模型采用部署在 Inference Endpoints 上的 WizardCoder-15B,通过 Express.js 流式渲染生成 HTML。
推荐理由:Hugging Face 官方教程给出从 Endpoint 部署到流式渲染的完整代码,读者可以照着复现一个文本生成网页应用的服务。
Apple 在 WWDC'23 中更新 Core ML 与 coremltools 的压缩优化能力,配合开源仓库 ml-stable-diffusion,支持将 Stable Diffusion 量化为 8/6/4/2-bit palettization,推荐 6-bit 以在精度损失很小的前提下加快推理并节省内存。
推荐理由:作者亲测 6-bit palettization 带来的生成速度提升,并给出完整转换命令和 Hub 模型,读者可按步骤迁移到自己微调的模型。
Hugging Face 宣布用户可以在 Hub 上的任何数据集上用 DuckDB 运行 SQL 查询。Dataset Viewer 会自动把所有公开数据集转换为 Parquet 文件,可通过 /parquet 端点获取文件 URL;借助 httpfs 扩展,DuckDB 能直接对远程 Parquet 文件执行 SQL,并支持查询被切分为 500MB 分块的大数据集。
推荐理由:官方介绍了用 DuckDB 直接对 Hub 上 5 万多数据集跑 SQL 的方法,读者可以照着把 Parquet 端点和查询代码迁移到自己的数据探索流程。
阿布扎比 Technology Innovation Institute 以 Apache 2.0 许可发布 Falcon-7B 和 Falcon-40B 模型,40B 版当时位列 Open LLM Leaderboard 第一。
推荐理由:原文由 Hugging Face 实测 Falcon 的推理、量化与 QLoRA 微调,并给出显存需求和代码,可直接迁移到自己的部署流程。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持 4bit 量化加载,并集成 Dettmers 等人新提出的 QLoRA 微调方法。
推荐理由:官方详细讲解 transformers 中 4bit 量化和 QLoRA 的用法与配置,附带在消费级 GPU 上微调 Llama 7B/13B 的实测结果。
RWKV 是一种结合 RNN 与 transformer 优势的新架构,已通过 PR 正式集成到 Hugging Face transformers 库。该架构训练时可并行(类似线性化 GPT),推理时仅需矩阵向量运算、内存不随上下文增长;已有训练上下文长度 8192 的模型与 ctx1024 模型速度和内存相当。
推荐理由:RWKV 结合 RNN 与 transformer 两种架构的优势,官方介绍了其原理、可用模型规模及在 transformers 库中的实际用法。
Hugging Face 在 Transformers 中推出 Assisted Generation 解码方法,用小模型生成候选 token、大模型前向传播验证,降低自回归文本生成延迟。
推荐理由:原文解释了文本生成延迟来自内存带宽而非计算,并给出 Assisted Generation 的原理、代码和延迟数据,方法可直接复现。
Hugging Face 团队将 BigCode 的 StarCoder(16B 参数、8,192 token 上下文)微调为编程助手 StarChat alpha。
推荐理由:原文完整展示了用 OpenAssistant 对话数据和 DeepSpeed ZeRO-3 将 StarCoder 微调为编程助手的可复现流程,并附评估方法。
Hugging Face 发布博客,梳理文本生成视频模型从 GAN、Transformer 到扩散模型的演进脉络,并对比文本生成图像任务解释其在计算成本、数据集和视频描述上的挑战。
推荐理由:系统梳理了文本生成视频模型的技术演进、数据集挑战与代表工作,并给出 Diffusers 上的可复用代码与演示入口。
BigCode(由 Hugging Face 与 ServiceNow 联合主导)发布约 15B 参数的代码大模型 StarCoder 和 StarCoderBase,在 1 万亿 token 上训练,覆盖 80+ 编程语言。
推荐理由:官方发布且附完整评测数据,读者可以据此对比开源代码模型与闭源模型的实际差距。
Hugging Face 发布端到端教程,演示用 TensorFlow 和 TPU 在 WikiText (v1) 数据集上从零训练 RoBERTa base 模型,涵盖训练 Unigram tokenizer、生成 TFRecord 分片上传 GCS、以及用 TPUStrategy 进行数据并行训练。
推荐理由:原文给出从 tokenizer 训练到 TPU 训练的完整流程与代码,读者可据此把 TensorFlow 训练管线迁移到 TPU。
Hugging Face 官方博客演示用 🧨 diffusers 在免费版 Google Colab(13GB CPU 内存、T4 15GB 显存)上运行 DeepFloyd 的开源文生图模型 IF,并支持图像变化和局部重绘。
推荐理由:官方博客给出在 13GB 内存免费 Colab 上跑通 40GB 参数 IF 的完整低显存方案,含可复用的代码和量化技巧。
Hugging Face 发布 StackLLaMA 模型及完整 RLHF 训练教程,演示如何将 LLaMA 7B 微调用于回答 Stack Exchange 问答。
推荐理由:Hugging Face 官方复盘 StackLLaMA 全流程训练细节,包括显存估算、LoRA 配置和 RLHF 训练中的稳定性坑,方法可直接迁移复用。
Hugging Face 发布教程,详解如何用 diffusers 训练 ControlNet,并以基于 Microsoft FaceSynthetics 10 万合成人脸数据集训练的 Uncanny Faces 面部姿态模型为例。
推荐理由:作者以亲身训练经历给出从数据集构建到训练参数的完整流程,还分享了过拟合教训和 8GB 显存的降配方法。
Hugging Face 官方发布 trl 与 peft 的集成,让用户能以更低成本用强化学习微调大语言模型。通过 8-bit 加载(LLM.int8)、低秩适配器以及用 disable_adapters 复用同一模型获取参考与主动 logits,作者在 24GB NVIDIA 4090 上验证了微调 20B gpt-neox 生成正面影评的完整流程,并指出训练速度和多卡扩展是下一步方向。
推荐理由:原文给出 trl 与 peft 集成的完整微调流程和显存拆解,读者可以照此在单张 24GB GPU 上复现大模型 RLHF 训练。
Hugging Face 发布教程,介绍如何在 Diffusers 中通过 StableDiffusionControlNetPipeline 使用 ControlNet,支持 canny 边缘、OpenPose 姿态等 8 种空间条件控制 Stable Diffusion 生成,并可组合多个条件或与 DreamBooth 微调结合。
推荐理由:原文给出 ControlNet 在 Diffusers 中的完整用法和加速省显存配置,读者可以照搬代码在 Colab 上复现同样的生成效果。
Hugging Face 发布教程,介绍 Salesforce Research 的 BLIP-2 模型已登陆 Transformers 库,并演示零样本图像描述、提示式图像描述、视觉问答和对话式提示四类用法。
推荐理由:文章拆解了 BLIP-2 的 Q-Former 架构和两阶段预训练方法,并给出在 Transformers 中跑通图生文、VQA 和对话提示的完整代码。
Hugging Face 宣布 diffusers 正式支持用 LoRA 对 Stable Diffusion 做全量微调和 Dreambooth 训练。
推荐理由:Hugging Face 官方介绍 diffusers 支持 LoRA 微调 Stable Diffusion,给出训练脚本、显存需求和推理加载流程,方法可直接复现。
Hugging Face 发布博客,系统梳理让对话智能体有用的关键技术 RLHF、IFT、SFT、CoT 与红队测试,并对比 LaMDA、BlenderBot 3、Sparrow、InstructGPT 与 Anthropic Assistant 的训练数据、模型规模与评估标准。文章指出指令微调所需数据远小于预训练,CoT 微调能提升逐步推理任务表现并减少对敏感话题的回避。
推荐理由:文章系统梳理了 RLHF、IFT、SFT、CoT 等技术如何让对话智能体有用,并对比主流模型差异。