跳到正文
原文
Hugging Face Blog·· 10 天前精选AI 评分70

transformers 现已支持运行 llama.cpp 的 GGUF 量化模型

Transformers now runs llama.cpp quants

AI 导读

Hugging Face 宣布 transformers 支持通过 from_pretrained 直接加载 GGUF 量化模型,复用 ggml 的 Metal 内核以接近 llama.cpp 的性能。

推荐理由

官方介绍 transformers 直接加载 GGUF 的用法、量化选择和与 llama.cpp 的对比数据,对想在 Mac 上本地推理的开发者有实用参考。

来源:Hugging Face Blog · huggingface.co