Hugging Face 与 Microsoft 合作,在 Azure 上推出 Hugging Face 模型目录
Hugging Face 与 Microsoft 合作,在 Azure Machine Learning Studio 内推出 Hugging Face Hub Model Catalog,收录 Hub 上数千个最受欢迎的 Transformers 模型。
Hugging Face 与 Microsoft 合作,在 Azure Machine Learning Studio 内推出 Hugging Face Hub Model Catalog,收录 Hub 上数千个最受欢迎的 Transformers 模型。
Hugging Face 与 bitsandbytes 合作,在 transformers 中支持 4bit 量化加载,并集成 Dettmers 等人新提出的 QLoRA 微调方法。
推荐理由:官方详细讲解 transformers 中 4bit 量化和 QLoRA 的用法与配置,附带在消费级 GPU 上微调 Llama 7B/13B 的实测结果。
Hugging Face 联合 EleutherAI 和 Stability AI 委托 Trail of Bits 对 safetensors 库完成外部安全审计,报告全文公开。
Hugging Face 与 Intel 合作推出 Q8-Chat 演示,基于 SmoothQuant 8-bit 量化,在单路 32 核 Intel Sapphire Rapids CPU、batch size 为 1 的条件下实现类 ChatGPT 聊天体验。
Hugging Face 发布教程,讲解如何用 ROCm 在单张 AMD GPU 上运行 4-bit GPTQ 量化的 Vicuna-13B 模型。经 RX6900XT(16GB 显存)实测,量化模型仅需 7.52GB 显存,而 fp16 需超过 28GB,延迟与精度损失极小。
Hugging Face 在 Transformers 中推出 Assisted Generation 解码方法,用小模型生成候选 token、大模型前向传播验证,降低自回归文本生成延迟。
推荐理由:原文解释了文本生成延迟来自内存带宽而非计算,并给出 Assisted Generation 的原理、代码和延迟数据,方法可直接复现。
Hugging Face Unity API 是对 Hugging Face Inference API 的易用集成,可在 Unity 项目中调用 Hugging Face 模型。
Hugging Face 发布端到端教程,演示用 TensorFlow 和 TPU 在 WikiText (v1) 数据集上从零训练 RoBERTa base 模型,涵盖训练 Unigram tokenizer、生成 TFRecord 分片上传 GCS、以及用 TPUStrategy 进行数据并行训练。
推荐理由:原文给出从 tokenizer 训练到 TPU 训练的完整流程与代码,读者可据此把 TensorFlow 训练管线迁移到 TPU。
Databricks 向 Hugging Face 代码库提交首个官方贡献:Datasets 新增 from_spark 函数,可将 Apache Spark dataframe 直接转为 Hugging Face Dataset,免去先写 Parquet 再重新加载的繁琐流程。16GB 数据集的处理时间从 22 分钟降至 12 分钟,缩短超过 40%。
Hugging Face 与 AWS 合作,针对 AWS Inferentia2 推理加速器优化 Hugging Face Transformers,通过 optimum neuron 只需一行代码即可编译模型。
Snorkel AI 与 Hugging Face 合作,将 Hugging Face 平台上超过 150,000 个开源模型接入 Snorkel Flow 开发平台,帮助企业针对自身用例适配基础模型。
Hugging Face 发布教程,演示多种技术在 Sapphire Rapids CPU 上加速 Stable Diffusion 推理。
Hugging Face 展示了如何用 Optimum Habana 在 Habana Gaudi2 上部署 1760 亿参数的 BLOOMZ。基准测试中,Gaudi2 生成 100 个 token 的延迟为 3.103 秒,比 A100 80GB 快 1.42 倍;BLOOMZ-7B 则快 2.89 倍。
这是一篇教程,讲解如何用 Flower 框架结合 Hugging Face,在多个客户端上对预训练模型 distilBERT 做联邦微调,完成 IMDB 影评正负情感分类任务。各客户端在本地训练模型并只上传参数,由服务器按预定义策略聚合,无需共享数据。教程还提供可在 Google Colab 中用 flwr['simulation'] 模拟联邦环境的 notebook。
Witty Works 在 Hugging Face 专家加速计划支持下,将写作助手从基于 spaCy 的语言学特征方案升级为上下文相关的非包容性词汇分类器。专家团队建议采用 Sentence Transformers 架构和 SetFit 少样本微调库,每个特定词仅需 15-20 个标注句子即可达到可用精度,省去大量标注成本。
消费返利公司 Fetch(月活用户超 1800 万)在 AWS 与 Hugging Face Expert Acceleration Program 支持下,从第三方方案转向自建 AI 工具处理用户上传的小票。
作者团队将原本跑在 AWS ECS + Fargate 上的 CPU 推理模型迁移到 Hugging Face Inference Endpoints,流程从七步简化为三步。实测中 RoBERTa 文本分类模型在 large 端点延迟约 80ms,比自建容器快一倍以上;成本增加 24% 到 50%(大型实例约每月多 $60),但省去了 API 和容器维护的时间成本。
Hugging Face 推出开源工具 AI vs. AI,托管在 Spaces 上,通过持续对战和 ELO 排名(初始分 1200,胜方 +10 / 负方 -10)对多智能体强化学习模型做相对评估。
Hugging Face 测试了 Intel Sapphire Rapids(r7iz.16xlarge)与 Ice Lake(c6i.16xlarge)服务器在 NLP 推理上的表现。
Hugging Face 宣布 diffusers 正式支持用 LoRA 对 Stable Diffusion 做全量微调和 Dreambooth 训练。
推荐理由:Hugging Face 官方介绍 diffusers 支持 LoRA 微调 Stable Diffusion,给出训练脚本、显存需求和推理加载流程,方法可直接复现。
Hugging Face 与 Microsoft ONNX Runtime 团队合作,通过 Optimum 库的 ORTTrainer API 为 Transformer 模型训练加速,配合 DeepSpeed ZeRO Stage 1 在单台 8 卡 Nvidia A100 节点上测得 39% 到 130% 的加速。
Hugging Face 官方博客发布教程,讲解如何用 Transformers 和 Datasets 构建图像相似度系统:用 nateraw/vit-base-beans checkpoint 提取图像嵌入向量,通过余弦相似度在 beans 数据集 100 个候选样本中检索与查询图最相似的 Top 5。
Hugging Face 发布教程,介绍如何用 Intel 第四代 Xeon(Sapphire Rapids)CPU 集群在 AWS 上加速 PyTorch 训练。
推荐理由:原文给出在 Intel Sapphire Rapids CPU 集群上做分布式训练的完整步骤和实测数据,读者可以照搬这套方法。
Habana Gaudi2 在训练和推理上的速度约为 Nvidia A100 80GB 的两倍。BERT 预训练中,Gaudi2 用时 2 小时 55 分钟,相比第一代 Gaudi 的 8 小时 53 分钟实现 x3.04 加速。
借助新发布的 Bumblebee 库——纯 Elixir 实现的 Hugging Face Transformers,GPT2 到 Stable Diffusion 等神经网络模型已可在 Elixir 中运行。
Hugging Face 联合 Apple 将 Stable Diffusion 权重转换为 Core ML 格式并上传 Hub,支持 v1.4、v1.5、v2 base 和 v2.1 base,可在 Apple Silicon 的 CPU、GPU 和 Neural Engine 上运行。
推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的转换与推理方法,包括 Python 和 Swift 两条路径及性能变体选择,可迁移到自己的工作流。
Hugging Face 发布教程,讲解如何用 🤗 Transformers 库的 Time Series Transformer 从零训练单变量概率时间序列预测模型,并使用 tourism_monthly 数据集(澳大利亚 366 个地区的月度旅游量)。
Hugging Face 梳理了在其 Hub 上部署模型的多种推理方案:免费试用的 Inference Widget 和 Inference API,以及面向生产环境的 Inference Endpoints 和 Spaces。
Hugging Face 博客发布实用教程,讲解如何用 Concrete-ML 库在 fully homomorphic encryption(FHE)设置下对加密数据构建情感分析模型,无需密码学背景。
Hugging Face 宣布新定价:逐步停用 Inference API 付费层,该 API 仍免费开放;企业级推理推荐使用新方案 Inference Endpoints,Spaces 也新增硬件升级。这些服务无需订阅,只需在账单设置中绑定信用卡,可绑定到组织;付费服务与订阅在每月月初扣费,账单设置中可管理 PRO 订阅、付款方式并查看过去三个月用量。
Hugging Face 基于大量实验讲解如何用 🧨 Diffusers 的 train_dreambooth.py 微调 Stable Diffusion,并给出推荐设置:低学习率配合逐步增加步数,人脸训练约需 800-1200 步(batch size 2、LR 1e-6),训练人脸时应使用 prior preservation 防止过拟合。
推荐理由:Hugging Face 用多组实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数、先验保留等关键超参建议,可直接照做。
Hugging Face 宣布将 Intel OpenVINO 加入 Optimum Intel,基于 OpenVINO 2022.2,可用 OVModels 在多种 Intel 处理器上运行托管在 hub 或本地的 Transformers 模型,并通过 NNCF 进行量化。
这是一篇 Hugging Face 教程,讲解如何以三种递进的抽象层级在多 GPU 上进行分布式数据并行(DDP)训练:原生 PyTorch 的 pytorch.distributed 模块、🤗 Accelerate 的轻量封装(代码几乎无需改动即可在单 GPU 和 TPU 上运行),以及 🤗 Transformers 的高层 Trainer API。
Hugging Face 推出 Inference Endpoints 服务,可将 Hub 上的模型一键部署到 AWS 等托管基础设施,省去容器打包、基础设施配置和 API 搭建等部署工作。
Diffusers 自 0.5.1 起支持 Flax,官方教程演示如何在 Google TPU 上用 FlaxStableDiffusionPipeline 运行 CompVis/stable-diffusion-v1-4 推理。
Hugging Face 团队发布长文,复盘为 BLOOM(176B 参数、352GB)搭建高效推理服务器的完整过程,最终实现约 5 倍延迟降低(350ms/token 降至 71ms/token)和 50 倍吞吐提升。
推荐理由:原文复盘了把 BLOOM 推理延迟从 350ms 降到 71ms 的完整优化路径,从 profiling 到自定义 kernel 都有可迁移的方法细节。
Hugging Face 官方详解 Accelerate 如何在普通硬件上加载并运行超大模型,示例可在免费 Colab 上运行 OPT-6.7B。
推荐理由:官方详解 Accelerate 借助 PyTorch meta device、分片加载与 hooks 实现超大模型推理的完整原理,方法可直接复用。
Hugging Face 演示了如何在 8x80GB A100 上高效运行 176B 参数的 BLOOM 模型(bf16 权重需 352GB)。
NVIDIA 的 Megatron-LM 是专为 GPU 高度优化的预训练框架,相比 🤗 Accelerate 和 Trainer 更快但上手门槛更高。它通过高效的 DataLoader 和融合 CUDA kernel(包括 Apex 的 Fused AdamW)减少内存搬移、加速训练。
这是一篇教程,讲解如何用 Hugging Face Transformers、Optimum Habana 和 Datasets 库,在 AWS DL1 实例(Habana Gaudi)上以掩码语言建模(MLM)任务从零预训练 BERT-base。