智迹闻AuraTracer
EN

EVENT DOSSIER

BeaconKV:基于Beacon查询的键值缓存压缩技术,用于高效实现大型推理模型的推理功能

2026-09-07 12:00 大模型 跨 2 天 🔥 47.2 事件热度
2家信源
2天持续发酵
47.2事件热度
1个提及
摘要由 AI 生成

针对大型推理模型(LRMs)因序列长度增加导致 KV 缓存线性增长而引发的内存瓶颈问题,研究团队提出了 BeaconKV 方法。该方法无需训练,通过维护代表全局查询簇的“信标”查询来预测将被重访的关键值对,利用长程推理中思维重访标记在嵌入空间聚类为少量相似组的特性,以信标查询替代近期查询以估计未来 token 的重要性。实验结果显示,BeaconKV 在四个开源 LRMs 及多样化推理基准测试中表现优异,相比现有压缩方法实现了高达 5.8 倍的内存缩减,同时几乎保持全缓存精度并将吞吐量提升超过 4.3 倍。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
BeaconKV

事件框架EVENT FRAME

产品发布

BeaconKV 提出基于信标查询的 KV 缓存压缩方法

整合时间线UNIFIED TIMELINE

  1. 2026-09-04

    BeaconKV: Key-Value Cache Compression G…

    BeaconKV 提出一种无需训练的 KV 缓存压缩方法,通过维护代表全局查询簇的“信标”查询来减少推理大模型内存占用。该方法利用长程推理中 Thought Revisiting Tokens(TRT)在嵌入空间中聚类为少量相似组的特性,…

  2. 2026-09-07

    BeaconKV: Key-Value Cache Compression G…

    Large Reasoning Models (LRMs) 因 KV 缓存随序列长度线性增长而面临严重的内存瓶颈。BeaconKV 提出一种无需训练的关键值缓存压缩方法,通过维护代表全局查询簇的“信标”查询来预测将被重访的 KV 对,避免…

信号强度SIGNALS

关键词热度
  • BeaconKV2

全部报道(2)SOURCES

A arXiv cs.CL en 2026-09-04 18:23

BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference

BeaconKV 提出一种无需训练的 KV 缓存压缩方法,通过维护代表全局查询簇的“信标”查询来减少推理大模型内存占用。该方法利用长程推理中 Thought Revisiting Tokens(TRT)在嵌入空间中聚类为少量相似组的特性,仅存储关键代表而非完整历史。实验表明,BeaconKV 在四个开源推理大模型及多种基准测试中表现优异,相比现有方法最高减少 $5.8\times$ 内存占用,同时保持接近全缓存的准确率并将吞吐量提升超过 $4.3\times$。

A arXiv cs.LG en 2026-09-07 12:00

BeaconKV: Key-Value Cache Compression Guided by Beacon Queries for Efficient Large Reasoning Model Inference

Large Reasoning Models (LRMs) 因 KV 缓存随序列长度线性增长而面临严重的内存瓶颈。BeaconKV 提出一种无需训练的关键值缓存压缩方法,通过维护代表全局查询簇的“信标”查询来预测将被重访的 KV 对,避免存储完整查询历史。该方法基于长程推理中 Thought Revisiting Tokens (TRT) 在嵌入空间中聚类为少量相似组的发现,利用这些信标查询替代近期查询以估计未来 token 重要性。实验表明,BeaconKV 在四个开源 LRMs 及多样化推理基准测试中表现优异,相比现有压缩方法实现了高达 $5.8\times$ 的内存缩减,同时几乎保持全缓存精度并将吞吐量提升超过 $4.3\times$。