来自微软的研究者近期公开了《Sliding-window beats linear attention》。论文追问了一个问题:为了压低长上下文推理的显存与计算成本,我们真的需要把已有模型“改造成”线性注意力吗?
标准全注意力会保留此前全部 Key/Value,序列越长,KV Cache 越大。线性注意力希望用固定大小的递归状态替代它,但把预训练模型转换过去,通常还要蒸馏或微调,并且模型必须在有限状态里持续决定哪些信息该保留、哪些可覆盖。
Sliding Window Attention(SWA)只看最近 w 个 token,同时始终保留最前面的 4 个 attention sinks。窗口限制了 KV Cache;跨层堆叠又让有效感受野逐层扩大。关键是,这种掩码可以直接用于已有模型,不需要后训练,也不依赖专门的线性注意力内核。
短上下文结果已经足够有竞争力。在 11 组模型比较里,SWA 的平均下游成绩有 9 组最佳;汇总后,它恢复了全注意力基线 93.2% 的 MMLU 表现和 99.0% 的六项任务平均表现,而且后训练 token 为 0。作为参照,LoLCATs 使用 4000 万 token 后训练,恢复率分别为 83.2% 和 97.5%。
差距在长上下文更明显。以 Llama 3.1 8B、窗口 256 为例,BABILong 平均准确率在 4K 上下文时,SWA 为 15%,LoLCATs 为 3%,前者是后者的 5 倍;相对全注意力的 60%,两者分别恢复 25% 与 5%。在 S-NIAH 的 4K 条件下,SWA 达到 17.2%–23%,LoLCATs 最多 5.8%,Liger-GLA 最多 0.8%。
论文还在一个 4 层、隐藏维度 1024、batch size 1、FP16 的小型 Transformer 上,用 NVIDIA RTX PRO 6000 Blackwell Max-Q 测了速度与状态内存:窗口较小的 SWA 速度最快,内存在达到窗口长度后保持不变。
AI论文 论文速读 大模型 LLM 注意力机制 SlidingWindowAttention LinearAttention 长上下文 推理优化 KVCache 模型效率 机器学习


