跳到正文

#部署/工程

今日 4 条
11月9日周四
11月7日周二
11月3日周五
10月27日周五
10月25日周三
10月24日周二
10月19日周四
  1. Hugging Face Blog62

    Gradio 发布 @gradio/lite,让 Gradio 应用在浏览器中无服务器运行

    Hugging Face 推出 @gradio/lite,通过 Pyodide 让 Gradio 应用直接在浏览器中运行,无需服务器端基础设施。开发者在 HTML 中引入 JS/CSS 并在 <gradio-lite> 标签内写 Python 代码即可,支持 <gradio-file> 多文件和 <gradio-requirements> 通过 micropip 安装依赖。

    推荐理由:原文给出完整的上手代码和依赖、加载时间等限制说明,读者可直接照做评估浏览器端部署是否适合自己。

10月4日周三
10月3日周二
10月2日周一
9月26日周二
9月22日周五
9月19日周二
  1. Hugging Face Blog30

    Rocket Money 携手 Hugging Face:在生产环境中扩展波动性 ML 模型

    个人理财应用 Rocket Money 用 BERT 系列模型替代维护成本高的 regex 系统,为 4000+ 类别的交易文本分类提供支持,其原有 regex 系统每月处理超 1 亿笔交易。在对比自建方案、AWS Sagemaker 和 Hugging Face Inference API 后,经三个月评估选择 Hugging Face 托管模型,一周内即承接部分流量并通过最坏情况负载测试。

9月15日周五
  1. Hugging Face Blog67

    Hugging Face 详解 LLM 生产环境推理优化:量化、Flash Attention 与架构改进

    Hugging Face 官方博客系统讲解 LLM 推理优化的三类技术:8-bit/4-bit 量化、Flash Attention 注意力算法,以及 RoPE、ALiBi、MQA、GQA 等架构改进。

    推荐理由:Hugging Face 官方以实测代码系统讲解量化、Flash Attention 与模型架构三类 LLM 推理优化方法,可迁移到部署实践。

9月13日周三
9月12日周二
9月11日周一
9月6日周三
9月1日周五
8月30日周三
  1. Hugging Face Blog67

    如何用 Diffusers 优化 AudioLDM 2 推理速度至 10 倍以上

    Hugging Face 官方教程讲解如何在 🧨 Diffusers 中运行 AudioLDM 2 文生音频管线,并通过 Flash Attention、float16 半精度、torch.compile 编译 UNet、切换 DPMSolverMultistepScheduler 将 10 秒音频的生成时间从约 14 秒降到 1 秒以内,且音质几乎不降。

    推荐理由:官方教程给出四种可复用的推理优化方法,把 10 秒音频的生成时间从约 14 秒压到 1 秒以内,可直接迁移到自己的管线。

8月25日周五
  1. Hugging Face Blog37

    Hugging Face Hub 将停止 Git 密码认证,改用访问令牌或 SSH 密钥

    Hugging Face 宣布自 2023 年 10 月 1 日起,通过 Git 操作 Hugging Face Hub 时不再支持密码认证,用户需改用个人访问令牌或 SSH 密钥。令牌具有唯一、可撤销、随机等安全优势。目前仍在使用密码的用户将收到邮件提醒,需在截止日期前完成切换,可通过 git remote set-url 命令更新仓库地址。

8月23日周三
  1. Hugging Face Blog74

    Hugging Face 在 Transformers 中集成 AutoGPTQ,支持 GPTQ 量化大语言模型

    Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 或 2-bit 精度量化和运行模型,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线。

    推荐理由:官方宣布 AutoGPTQ 集成进 Transformers,读者可据此了解 4-bit 量化 LLM 的内存收益、用法与局限。

8月22日周二
8月10日周四
8月9日周三
8月8日周二
8月4日周五
7月17日周一
  1. Hugging Face Blog56

    Hugging Face 开源文本生成与 LLM 生态综述

    Hugging Face 发布博客,介绍其开源文本生成与大语言模型生态,覆盖 Llama 2 等开源模型、许可证对比、text-generation-inference 服务方案及 PEFT 微调工具。文中列出 Falcon 40B、MPT-30B、XGen、StarCoder 等模型的许可与用途,说明 TGI 已支撑 HuggingChat,并介绍 LoRA 等参数高效微调方法。

7月14日周五
7月4日周二
7月1日周六
6月29日周四
  1. Hugging Face Blog32

    加速视觉语言模型:BridgeTower 在 Habana Gaudi2 上的性能实测

    Hugging Face 在 Habana Gaudi2 上对 866M 参数的视觉语言模型 BridgeTower Large 进行微调加速。基于 Optimum Habana v1.7,配合硬件加速数据加载,Gaudi2 微调速度达到 A100 的 2.5 倍、H100 的 1.4 倍,吞吐最高达 768.7 samples/s。这些数据加载优化技术同样适用于其他受数据加载瓶颈约束的视觉模型。

6月15日周四
6月13日周二
6月12日周一
  1. Hugging Face Blog31

    面向 GLAM 行业的 Hugging Face Hub 使用指南

    Hugging Face 撰文介绍 GLAM(美术馆、图书馆、档案馆和博物馆)行业如何使用并贡献 Hugging Face Hub。Hub 目前托管超过 190,000 个模型、33,000 个数据集和 100,000 多个应用与演示,用户可按任务和语言筛选模型,并通过浏览器界面直接上传 CSV 数据集,或用 Spaces 托管 Gradio、Streamlit 及 Docker 应用。

5月31日周三
5月25日周四