VQ-Diffusion 文生图模型详解
中科大与 Microsoft 开发的 VQ-Diffusion 是一个条件潜在扩散模型,其加噪与去噪过程在由离散向量组成的量化潜在空间上进行,现可通过 🧨 Diffusers 加载 microsoft/vq-diffusion-ithq 管线几行代码运行,支持 FP16 权重。
中科大与 Microsoft 开发的 VQ-Diffusion 是一个条件潜在扩散模型,其加噪与去噪过程在由离散向量组成的量化潜在空间上进行,现可通过 🧨 Diffusers 加载 microsoft/vq-diffusion-ithq 管线几行代码运行,支持 FP16 权重。
Hugging Face 宣布启动 2023 年实习计划,开放多个岗位:Open Source 团队的 Accelerate 实习和 Text to Speech 实习。
Hugging Face 联合 Jonathan Whitaker 推出的免费扩散模型课程将于 11 月 28 日发布,并定于 11 月 30 日举办社区直播活动。
Hugging Face「机器学习总监洞察」系列第四篇,采访 Javier Mansilla、Shaun Gittens、Samuel Franklin 和 Evan Castle 四位机器学习总监。
Hugging Face 梳理了在其 Hub 上部署模型的多种推理方案:免费试用的 Inference Widget 和 Inference API,以及面向生产环境的 Inference Endpoints 和 Spaces。
Hugging Face 与 arXiv 合作,在 arXivLabs 上集成 Hugging Face Spaces 的 Demos 标签,读者可在论文页面直接找到社区或作者创建的开源 demo。
Hugging Face 博客发布实用教程,讲解如何用 Concrete-ML 库在 fully homomorphic encryption(FHE)设置下对加密数据构建情感分析模型,无需密码学背景。
Hugging Face 宣布新定价:逐步停用 Inference API 付费层,该 API 仍免费开放;企业级推理推荐使用新方案 Inference Endpoints,Spaces 也新增硬件升级。这些服务无需订阅,只需在账单设置中绑定信用卡,可绑定到组织;付费服务与订阅在每月月初扣费,账单设置中可管理 PRO 订阅、付款方式并查看过去三个月用量。
Hugging Face 宣布对比搜索解码方法进入 transformers 4.24.0,支持 PyTorch 和 TensorFlow,并附 Colab 与在线对比演示。
推荐理由:原文用 GPT-2 和 OPT 的实例对比贪心、nucleus 采样与对比搜索的输出质量,并给出可复用的代码参数。
Hugging Face 基于大量实验讲解如何用 🧨 Diffusers 的 train_dreambooth.py 微调 Stable Diffusion,并给出推荐设置:低学习率配合逐步增加步数,人脸训练约需 800-1200 步(batch size 2、LR 1e-6),训练人脸时应使用 prior preservation 防止过拟合。
推荐理由:Hugging Face 用多组实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数、先验保留等关键超参建议,可直接照做。
Hugging Face 发布分步教程,讲解如何用 🤗 Transformers、Datasets 和 Hub 对 Whisper 做多语言 ASR 微调,涵盖模型原理、Common Voice 数据准备、WhisperProcessor、Seq2SeqTrainer 训练与 WER 评估。
推荐理由:教程展示了仅用 8 小时 Common Voice 印地语数据微调 Whisper small,把 WER 从 63.5% 降到 32.0%,方法可迁移到其他低资源语言。
Hugging Face 宣布将 Intel OpenVINO 加入 Optimum Intel,基于 OpenVINO 2022.2,可用 OVModels 在多种 Intel 处理器上运行托管在 hub 或本地的 Transformers 模型,并通过 NNCF 进行量化。
Hugging Face 在 🤗 Evaluate 库中新增偏见评估指标,用于探究 GPT-2、BLOOM 等因果语言模型(CLM)编码的社会偏见。工作流分两步:用 🤗 Datasets 上的预定义提示词驱动模型生成,再用 Evaluate 的指标评估,涵盖毒性、语言极性、伤害性三类任务。示例中仅改变代词 he/she,GPT-2 补全的女性代词毒性比例为 0.333,男性为 0.0。
这是一篇 Hugging Face 教程,讲解如何以三种递进的抽象层级在多 GPU 上进行分布式数据并行(DDP)训练:原生 PyTorch 的 pytorch.distributed 模块、🤗 Accelerate 的轻量封装(代码几乎无需改动即可在单 GPU 和 TPU 上运行),以及 🤗 Transformers 的高层 Trainer API。
Hugging Face 发布 MTEB(Massive Text Embedding Benchmark),用于衡量文本嵌入模型在多种任务上的表现,排行榜已汇总超过 2000 个结果。
Hugging Face 推出 Inference Endpoints 服务,可将 Hub 上的模型一键部署到 AWS 等托管基础设施,省去容器打包、基础设施配置和 API 搭建等部署工作。
Diffusers 自 0.5.1 起支持 Flax,官方教程演示如何在 Google TPU 上用 FlaxStableDiffusionPipeline 运行 CompVis/stable-diffusion-v1-4 推理。
Hugging Face 团队发布长文,复盘为 BLOOM(176B 参数、352GB)搭建高效推理服务器的完整过程,最终实现约 5 倍延迟降低(350ms/token 降至 71ms/token)和 50 倍吞吐提升。
推荐理由:原文复盘了把 BLOOM 推理延迟从 350ms 降到 71ms 的完整优化路径,从 profiling 到自定义 kernel 都有可迁移的方法细节。
Hugging Face Hub 正式支持为模型或数据集生成 DOI(数字对象标识符),用户可在仓库设置中直接生成,他人通过页面上的“Cite this model/dataset”按钮引用。DOI 由 Hugging Face 与 DataCite 合作提供,绑定元数据并生成永久链接;模型或数据集发布新版本时可更新 DOI,旧版 DOI 随之失效。
rinna 基于 Stable Diffusion 微调出日语文生图模型 Japanese Stable Diffusion,接受日语提示词并生成反映日语圈文化的图像。
Hugging Face 的 Evaluation on the Hub 功能升级,任何 Hub 上的 causal language model 现在都能免代码进行零样本分类评估,由 AutoTrain 驱动且免费。
Hugging Face 的零代码机器学习平台 AutoTrain 新增图像分类任务,用户无需写代码即可上传数据训练模型。AutoTrain 会自动尝试多个候选模型,演示项目中 5 个候选模型里最佳者达到 84% 准确率,表现差的会被自动停止以免浪费资源;使用 5 个候选模型和少于 500 张图像训练免费,训练好的模型可在 Hub 上通过 inference widget 直接试用。
Hugging Face 官方详解 Accelerate 如何在普通硬件上加载并运行超大模型,示例可在免费 Colab 上运行 OPT-6.7B。
推荐理由:官方详解 Accelerate 借助 PyTorch meta device、分片加载与 hooks 实现超大模型推理的完整原理,方法可直接复用。
Hugging Face 联合 Intel Labs 和 UKP Lab 发布 SetFit,一个无需提示词的少样本文本分类框架。每类仅需 8 个标注样本即可在 Customer Reviews 数据集上媲美用全量 3k 样本微调的 RoBERTa Large;在 RAFT 基准上 355M 参数的 SetFit 超过 PET 和 GPT-3。
推荐理由:官方详解 SetFit 的原理、训练成本和 RAFT 实测数据,并附可复现的训练代码,方便直接上手做少样本分类。
Hugging Face 推出 Ethics and Society Newsletter,由公司内跨团队的"Ethics and Society regulars"开放小组编写,计划每季度在春分、夏至、秋分、冬至发布。
Hugging Face 演示了如何在 8x80GB A100 上高效运行 176B 参数的 BLOOM 模型(bf16 权重需 352GB)。
Hugging Face 发布 diffusers 0.3,为 Stable Diffusion 新增图像到图像生成、Textual Inversion(3-5 张样本即可训练并分享概念,社区已贡献超 200 个概念)和实验性 inpainting 管线。
推荐理由:官方梳理 diffusers 0.3 的图生图、Textual Inversion、低显存优化等新能力,读者可以据此判断扩散模型工具链的可用性变化。
Hugging Face 发布教程,讲解如何用 transformers Trainer 和自定义 Data Collator 从零训练 Offline Decision Transformer,让智能体在 Gym HalfCheetah 环境中奔跑。
NVIDIA 的 Megatron-LM 是专为 GPU 高度优化的预训练框架,相比 🤗 Accelerate 和 Trainer 更快但上手门槛更高。它通过高效的 DataLoader 和融合 CUDA kernel(包括 Apex 的 Fused AdamW)减少内存搬移、加速训练。
Hugging Face 支持的 RAIL Initiative 推出 OpenRAIL(开放且负责任的 AI 许可证),旨在让 AI 模型在开放获取、使用和再分发的同时约束负责任使用。
这篇 Hugging Face 教程讲解如何用 Gradio 的 HTML block 和 3Dmol.js 在 Hugging Face Spaces 中构建蛋白质结构查看器,支持输入 4 位 PDB 编码或上传 PDB 文件,并从 RCSB Protein Databank 获取结构进行渲染。
Hugging Face 官方博客发布教程,展示如何用 🧨 Diffusers 库运行 Stable Diffusion v1-4 文生图模型,模型由 CompVis、Stability AI 和 LAION 基于 LAION-5B 子集的 512x512 图像训练。
推荐理由:官方教程从StableDiffusionPipeline基础用法讲到自定义推理管线,读者可以按步骤复现文生图并理解潜在扩散的三个组件。
这是一篇教程,讲解如何用 Hugging Face Transformers、Optimum Habana 和 Datasets 库,在 AWS DL1 实例(Habana Gaudi)上以掩码语言建模(MLM)任务从零预训练 BERT-base。
Hugging Face 讲解如何把此前已在本地和 Kubernetes 部署过的 ViT B/16 TensorFlow 模型部署到 Google Cloud 的 Vertex AI 平台,用更少的代码获得与 Kubernetes 相当的扩展性。
Hugging Face 展示如何用 Optimum Graphcore 库在 Graphcore IPU 上微调视觉 Transformer(ViT)模型,示例为在 ImageNet-21k 预训练的 ViT 上微调 ChestX-ray14 胸部 X 光数据集。
Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等 176B 参数大模型的推理显存占用减半且性能不下降。
推荐理由:原文由集成团队讲解 LLM.int8() 的量化原理、零性能下降验证和 transformers 集成细节,读者可据此在有限显存上运行大模型。
Hugging Face 发布新库 Skops,让用户将 scikit-learn 模型托管到 Hugging Face Hub 并创建模型卡。
Hugging Face 阐述其 transformers 库对 TensorFlow 的设计理念:所有 TF 模型都应是 Keras Model 对象,所有层都是 Keras Layer 对象,从而可直接使用 fit()、compile()、predict() 等方法。
这是一篇教程,讲解如何将上一篇文章中用 TensorFlow Serving 本地部署的 Vision Transformer (ViT) 模型,通过 Docker 容器化和 Kubernetes 集群扩展为可服务大量用户的部署。
Hugging Face 教程讲解如何从零构建或微调 Sentence Transformers 模型:先用 distilroberta-base 等 Transformer 输出 token 嵌入,再经池化层得到固定长度句子嵌入。