Hugging Face Blog·· 2023-03-28AI 评分29
如何在 Habana Gaudi2 加速器上高速推理 BLOOMZ 大语言模型
Fast Inference on Large Language Models: BLOOMZ on Habana Gaudi2 Accelerator
AI 导读
Hugging Face 展示了如何用 Optimum Habana 在 Habana Gaudi2 上部署 1760 亿参数的 BLOOMZ。基准测试中,Gaudi2 生成 100 个 token 的延迟为 3.103 秒,比 A100 80GB 快 1.42 倍;BLOOMZ-7B 则快 2.89 倍。
来源:Hugging Face Blog · huggingface.co