Hugging Face Blog·· 2023-05-16AI 评分50
Hugging Face 与 Intel 发布 Q8-Chat,用 SmoothQuant 让 LLM 在 Xeon CPU 上高效运行
Smaller is better: Q8-Chat, an efficient generative AI experience on Xeon
AI 导读
Hugging Face 与 Intel 合作推出 Q8-Chat 演示,基于 SmoothQuant 8-bit 量化,在单路 32 核 Intel Sapphire Rapids CPU、batch size 为 1 的条件下实现类 ChatGPT 聊天体验。
来源:Hugging Face Blog · huggingface.co