在推理时应用滑动窗口注意力机制到预训练的LLM上 [P]
开发者 ahsoar8 实现了针对预训练 Hugging Face 因果大语言模型的滑动窗口注意力(SWA)实用方案,旨在限制生成 token 对完整历史 KV cache 的访问。该实现作为可复用推理层,包含有界 KV cache、环形缓冲区存储及流式前缀等功能,无需修改或重新训练模型。在 Qwen2.5-7B 实验中,SWA-64 将 16K 上下文下的 TPOT 从约 38.4 ms 降至 30.5 ms,并将 KV cache 内存占用从 1.84 GB 大幅降低至 3.5 MB。然而,此方案存在权衡:若任务需信息超出活动窗口,性能可能下降。作者正进一步研究该现象是 SWA 固有特性还是实现/模型特定行为,并寻求社区反馈以优化验证架构、故障案例及与现有 HF 推理工作流的集成。