Hugging Face Blog·· 2025-09-29AI 评分46
在 Intel Core Ultra 上用深度剪枝草稿模型加速 Qwen3-8B Agent
Accelerating Qwen3-8B Agent on Intel® Core™ Ultra with Depth-Pruned Draft Models
AI 导读
Hugging Face 与 Intel 基于 OpenVINO 在 Intel Core Ultra 集成 GPU 上加速 Qwen3-8B:用 Qwen3-0.6B 作草稿模型的投机解码带来约 1.3× 提速,再从草稿模型 28 层中剪掉 6 层并用 Qwen3-8B 生成的 500k 提示词数据微调后,提速提升至约 1.4×。
来源:Hugging Face Blog · huggingface.co