跳到正文
原文
Hugging Face Blog·· 2023-08-23精选AI 评分74

Hugging Face 在 Transformers 中集成 AutoGPTQ,支持 GPTQ 量化大语言模型

Making LLMs lighter with AutoGPTQ and transformers

AI 导读

Hugging Face 宣布将 AutoGPTQ 库集成进 Transformers,用户可用 GPTQ 算法以 8、4、3 或 2-bit 精度量化和运行模型,4-bit 量化精度损失可忽略,小 batch 下推理速度接近 fp16 基线。

推荐理由

官方宣布 AutoGPTQ 集成进 Transformers,读者可据此了解 4-bit 量化 LLM 的内存收益、用法与局限。

来源:Hugging Face Blog · huggingface.co