C
发布于 2026/09/03 · 阅读 1
Transformer 真的需要三个投影吗?QKV 变体的系统性研究
- #Transformer
- #注意力机制
- #模型压缩
- #Hacker News
- #arxiv.org
摘要
Transformer已成为各种AI任务的标准解决方案,其中查询、键和值(QKV)注意力公式发挥着核心作用。然而,这三个投影的各自贡献以及省略其中一些的影响仍然知之甚少。我们系统评估了三种投影共享约束:a) Q-K=V(共享键值),b) Q=K-V(共享查询键),c) Q=K=V(单一投影)。后两种变体产生对称注意力图;为解决此问题,我们还通过2D位置编码探索了非对称注意力。通过跨合成任务、视觉(MNIST、CIFAR、TinyImageNet、异常检测)和语言建模(300M和12亿参数模型在100亿tokens上)的实验,我们发现我们的Transformer表现与QKV Transformer相当,甚至偶尔更好。在语言建模中,Q-K=V投影共享实现了50%的KV缓存缩减,仅带来3.1%的困惑度退化。关键的是,投影共享与头共享(GQA/MQA)互补:将Q-K=V与GQA-4结合可获得87.5%的缓存缩减,而Q-K=V + MQA则达到96.9%,实现了实用的设备端推理。我们表明Q-K=V能保持质量,因为键和值可以占据相似的表示空间,且注意力在低秩机制下运作,而Q=K-V破坏了注意力的方向性。我们的结果系统地将投影共享描述为注意力中权重绑定的一个未被充分探索的实例,具有直接、可量化的推理内存优势,尤其对边缘部署有价值。代码已公开。
评论: 被ICML 2026接收(PMLR卷306)。26页,12张图,16张表。
1 阅读0 评论0 点赞
评论