跳到正文

部署工程

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

115条精选相关主题开源生态数据与训练端侧 AI

最新精选

第 81–100 条 · 共 115 条
3月20日周三
  1. Hugging Face Blog64

    Hugging Face 介绍 GaLore:在消费级 GPU 上训练大语言模型的内存优化方法

    Hugging Face 官方博客介绍 GaLore 如何利用梯度低秩结构降低训练内存,支持在 RTX 4090 等消费级 GPU 上预训练 Llama 架构 7B 模型。优化器状态内存可减少超过 82.5%,可与 8-bit 优化器结合,并支持通过 transformers>=4.39.0 和 galore-torch 使用 galore_adamw 等优化器及 _layerwise 逐层更新。

    推荐理由:原文给出GaLore在消费级硬件上预训练7B模型的方法细节和Transformers接入方式,可迁移到实际训练工作流。

3月18日周一
  1. Hugging Face Blog61

    Hugging Face 发布 Quanto:面向 Optimum 的 PyTorch 量化后端

    Hugging Face 推出 quanto,一个面向 Optimum 的 PyTorch 量化后端,支持 int2/int4/int8 和 float8 权重、int8 和 float8 激活,可在 CUDA、MPS 等任意设备上运行。

    推荐理由:原文给出 Quanto 的量化能力边界、完整工作流和 transformers 集成方式,读者可直接照此把 float 模型转到低精度部署。

1月25日周四
1月14日周日
1月10日周三
12月20日周三
12月11日周一
11月9日周四
10月27日周五
10月24日周二
10月19日周四
  1. Hugging Face Blog62

    Gradio 发布 @gradio/lite,让 Gradio 应用在浏览器中无服务器运行

    Hugging Face 推出 @gradio/lite,通过 Pyodide 让 Gradio 应用直接在浏览器中运行,无需服务器端基础设施。开发者在 HTML 中引入 JS/CSS 并在 <gradio-lite> 标签内写 Python 代码即可,支持 <gradio-file> 多文件和 <gradio-requirements> 通过 micropip 安装依赖。

    推荐理由:原文给出完整的上手代码和依赖、加载时间等限制说明,读者可直接照做评估浏览器端部署是否适合自己。

10月3日周二
9月15日周五
  1. Hugging Face Blog67

    Hugging Face 详解 LLM 生产环境推理优化:量化、Flash Attention 与架构改进

    Hugging Face 官方博客系统讲解 LLM 推理优化的三类技术:8-bit/4-bit 量化、Flash Attention 注意力算法,以及 RoPE、ALiBi、MQA、GQA 等架构改进。

    推荐理由:Hugging Face 官方以实测代码系统讲解量化、Flash Attention 与模型架构三类 LLM 推理优化方法,可迁移到部署实践。

9月6日周三
8月30日周三
  1. Hugging Face Blog67

    如何用 Diffusers 优化 AudioLDM 2 推理速度至 10 倍以上

    Hugging Face 官方教程讲解如何在 🧨 Diffusers 中运行 AudioLDM 2 文生音频管线,并通过 Flash Attention、float16 半精度、torch.compile 编译 UNet、切换 DPMSolverMultistepScheduler 将 10 秒音频的生成时间从约 14 秒降到 1 秒以内,且音质几乎不降。

    推荐理由:官方教程给出四种可复用的推理优化方法,把 10 秒音频的生成时间从约 14 秒压到 1 秒以内,可直接迁移到自己的管线。

8月23日周三
  1. Hugging Face Blog74

    Hugging Face 在 Transformers 中集成 AutoGPTQ,支持 GPTQ 量化大语言模型

    Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 或 2-bit 精度量化和运行模型,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线。

    推荐理由:官方宣布 AutoGPTQ 集成进 Transformers,读者可据此了解 4-bit 量化 LLM 的内存收益、用法与局限。

8月8日周二
5月24日周三
5月11日周四
  1. Hugging Face Blog68

    Hugging Face 发布 Assisted Generation 解码方法,文本生成延迟最多降低 10 倍

    Hugging Face 在 Transformers 中推出 Assisted Generation 解码方法,用小模型生成候选 token、大模型前向传播验证,降低自回归文本生成延迟。

    推荐理由:原文解释了文本生成延迟来自内存带宽而非计算,并给出 Assisted Generation 的原理、代码和延迟数据,方法可直接复现。