Hugging Face Blog·· 2024-01-30AI 评分37
如何用 Optimum Intel 在 Xeon 上加速 StarCoder:Q8/Q4 量化与投机解码
Accelerate StarCoder with 🤗 Optimum Intel on Xeon: Q8/Q4 and Speculative Decoding
AI 导读
Hugging Face 联合 Intel 展示了在第四代 Xeon(借助 AMX 加速)上优化 StarCoder-15B 推理的方法,通过 SmoothQuant 实现 Q8 量化,TTFT 加速约 2.19x、TPOT 加速约 2.20x 且精度无损失;再结合 4bit 权重唯一量化和 assisted generation,实现超过 7x 的推理加速。
来源:Hugging Face Blog · huggingface.co