跳到正文
原文
Hugging Face Blog·· 2023-05-16AI 评分50

Hugging Face 与 Intel 发布 Q8-Chat,用 SmoothQuant 让 LLM 在 Xeon CPU 上高效运行

Smaller is better: Q8-Chat, an efficient generative AI experience on Xeon

AI 导读

Hugging Face 与 Intel 合作推出 Q8-Chat 演示,基于 SmoothQuant 8-bit 量化,在单路 32 核 Intel Sapphire Rapids CPU、batch size 为 1 的条件下实现类 ChatGPT 聊天体验。

来源:Hugging Face Blog · huggingface.co