BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference
BeaconKV 提出一种无需训练的 KV 缓存压缩方法,通过维护代表全局查询簇的“信标”查询来减少推理大模型内存占用。该方法利用长程推理中 Thought Revisiting Tokens(TRT)在嵌入空间中聚类为少量相似组的特性,仅存储关键代表而非完整历史。实验表明,BeaconKV 在四个开源推理大模型及多种基准测试中表现优异,相比现有方法最高减少 $5.8\times$ 内存占用,同时保持接近全缓存的准确率并将吞吐量提升超过 $4.3\times$。