跳到正文
原文
Hugging Face Blog·· 2026-01-20AI 评分45

Microsoft 提出 Differential Transformer V2:更快解码且无需自定义 kernel

Differential Transformer V2

AI 导读

微软团队(Tianzhu Ye、Li Dong、Yutao Sun、Furu Wei)发布 DIFF Transformer V2,在 DIFF V1 基础上让相减的两个 head 共享同一 GQA 组的 key 和 value,不再增加 KV head,解码速度与标准 Transformer 相当,也无需自定义 attention kernel。

来源:Hugging Face Blog · huggingface.co