跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

118条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 101–118 条 · 共 118 条
5月24日周三
5月11日周四
  1. Hugging Face Blog68

    Hugging Face 发布 Assisted Generation 解码方法,文本生成延迟最多降低 10 倍

    Hugging Face 在 Transformers 中推出 Assisted Generation 解码方法,用小模型生成候选 token、大模型前向传播验证,降低自回归文本生成延迟。

    推荐理由:原文解释了文本生成延迟来自内存带宽而非计算,并给出 Assisted Generation 的原理、代码和延迟数据,方法可直接复现。

4月27日周四
  1. Hugging Face Blog61

    Hugging Face 教程:用 TensorFlow 和 TPU 从零训练 RoBERTa 语言模型

    Hugging Face 发布端到端教程,演示用 TensorFlow 和 TPU 在 WikiText (v1) 数据集上从零训练 RoBERTa base 模型,涵盖训练 Unigram tokenizer、生成 TFRecord 分片上传 GCS、以及用 TPUStrategy 进行数据并行训练。

    推荐理由:原文给出从 tokenizer 训练到 TPU 训练的完整流程与代码,读者可据此把 TensorFlow 训练管线迁移到 TPU。

1月26日周四
1月2日周一
12月1日周四
  1. Hugging Face Blog73

    Hugging Face 发布 Stable Diffusion 的 Core ML 转换权重及 Apple Silicon 使用教程

    Hugging Face 联合 Apple 将 Stable Diffusion 权重转换为 Core ML 格式并上传 Hub,支持 v1.4、v1.5、v2 base 和 v2.1 base,可在 Apple Silicon 的 CPU、GPU 和 Neural Engine 上运行。

    推荐理由:原文给出在 Apple Silicon 上用 Core ML 跑 Stable Diffusion 的转换与推理方法,包括 Python 和 Swift 两条路径及性能变体选择,可迁移到自己的工作流。

11月7日周一
  1. Hugging Face Blog73

    Hugging Face 分享用 Diffusers 训练 Stable Diffusion Dreambooth 的实验结论与推荐设置

    Hugging Face 基于大量实验讲解如何用 🧨 Diffusers 的 train_dreambooth.py 微调 Stable Diffusion,并给出推荐设置:低学习率配合逐步增加步数,人脸训练约需 800-1200 步(batch size 2、LR 1e-6),训练人脸时应使用 prior preservation 防止过拟合。

    推荐理由:Hugging Face 用多组实验给出 Dreambooth 微调 Stable Diffusion 的学习率、步数、先验保留等关键超参建议,可直接照做。

10月12日周三
  1. Hugging Face Blog63

    Hugging Face 详解 BLOOM 推理优化历程:延迟降低 5 倍、吞吐提升 50 倍

    Hugging Face 团队发布长文,复盘为 BLOOM(176B 参数、352GB)搭建高效推理服务器的完整过程,最终实现约 5 倍延迟降低(350ms/token 降至 71ms/token)和 50 倍吞吐提升。

    推荐理由:原文复盘了把 BLOOM 推理延迟从 350ms 降到 71ms 的完整优化路径,从 profiling 到自定义 kernel 都有可迁移的方法细节。

9月27日周二
8月17日周三
  1. Hugging Face Blog74

    Hugging Face 详解 LLM.int8():用 bitsandbytes 实现 8-bit 量化推理

    Hugging Face 与 BigScience 将 LLM.int8() 8-bit 量化集成进 transformers 和 accelerate,使 BLOOM-176B 等 176B 参数大模型的推理显存占用减半且性能不下降。

    推荐理由:原文由集成团队讲解 LLM.int8() 的量化原理、零性能下降验证和 transformers 集成细节,读者可据此在有限显存上运行大模型。

7月27日周三
5月16日周一
  1. Hugging Face Blog60

    Gradio 3.0 发布,带来前端重设计与 Blocks API

    Hugging Face 发布 Gradio 3.0,这是 Gradio 库的全面重设计。新版本基于 Svelte 重建前端,页面加载更快、载荷更小,改进了 Dataframe 等组件并新增 Gallery、TabbedInterface;同时推出底层 Blocks API,支持自定义布局、多步数据流和根据用户输入改变组件属性或可见性。

    推荐理由:官方介绍了 Gradio 3.0 的前端重设计和新 Blocks API 能力,想用 Python 构建自定义 ML 演示界面的读者可以了解能做什么。

2月1日周二
10月5日周二
  1. Hugging Face Blog62

    Hugging Face 教你用 Gradio 在 Spaces 上展示模型演示

    Hugging Face 发布教程,讲解如何用 Gradio 集成和 Spaces 托管 Hub 模型的演示应用。定义 Interface 并调用 .launch() 即可运行演示,底层通过 Inference API 支持 Transformers、spaCy、SpeechBrain 等框架以及 image-to-text、speech-to-text 等模型类型。

    推荐理由:官方教程给出几行代码即可在 Spaces 托管 Hub 模型演示的方法,含自定义模型部署和串联多模型的示例。

7月28日周三
  1. OpenAI News62

    OpenAI 开源 Triton 1.0:让研究者无需 CUDA 经验即可编写高效 GPU 代码

    OpenAI 发布开源的类 Python 编程语言 Triton 1.0,供编写神经网络 GPU 代码。没有 CUDA 经验的研究者也能写出高效 GPU 代码,多数情况下效率与专家产出相当。

    推荐理由:原文说明无 CUDA 经验的研究者也能用它写出接近专家水平的 GPU 代码,可据此评估对研究工作流的影响。

4月16日周五
  1. Hugging Face Blog61

    Hugging Face 发布 Accelerate 库,五行代码让 PyTorch 训练脚本适配任意分布式设备

    Hugging Face 发布开源库 Accelerate,用户只需在标准 PyTorch 训练脚本中添加约五行代码,即可在多 GPU、TPU、混合精度等任意分布式环境下运行,且保留对训练循环的完全控制。

    推荐理由:原文给出在标准 PyTorch 脚本上加约五行代码即可迁移多 GPU、TPU 和混合精度的具体做法,可与手写 DistributedDataParallel 对比参考。

1月19日周二
7月22日周一
  1. OpenAI News77

    Microsoft 向 OpenAI 投资 10 亿美元并达成 AGI 合作

    Microsoft 向 OpenAI 投资 10 亿美元,支持其构建惠益广泛分布的 AGI。双方将在 Microsoft Azure 内共同开发可扩展至 AGI 的软硬件平台和新的 Azure AI 超算技术,Microsoft 将成为 OpenAI 的独家云提供商。

    推荐理由:OpenAI 官方宣布与 Microsoft 的投资与合作细节,涵盖资金规模和 Azure 独家云协议,可用于理解双方后续算力布局的起点。