智迹闻AuraTracer
EN

EVENT DOSSIER

GrowPage:用于高效LLM推理服务的按需KV预算分配

2026-09-04 12:00 大模型 🔥 11.4 事件热度
1家信源
1天持续发酵
11.4事件热度
1个提及
摘要由 AI 生成

长输出推理使关键值(KV)缓存成为高效 LLM 推理服务的瓶颈。现有的 KV 压缩方法通常依赖预设的请求级预算,仅决定保留哪些 KV 状态,而 KV 总容量在整个解码过程中保持不变。然而,推理工作负载表现出显著的请求级需求变化:不同请求需要不同的 KV 容量,且单个请求的注意力需求在生成过程中会演变。我们提出了 GrowPage,一种按需 KV 预算框架,将 KV 容量视为运行时资源。GrowPage 维护轻量级的双时间尺度查询摘要,以捕捉近期和长期的注意力行为,并利用这些摘要估计需求演变。在每个容量边界,GrowPage 动态调整 KV 分配策略,从而在保持推理性能的同时显著降低 KV 缓存开销。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
GrowPage

信号强度SIGNALS

关键词热度
  • GrowPage1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-04 12:00

GrowPage:按需配置KV预算,以实现高效的LLM推理服务

# GrowPage: On-Demand KV Budgeting for Efficient LLM Reasoning Serving ## 摘要 长输出推理使关键值(KV)缓存成为高效 LLM 推理服务的瓶颈。现有的 KV 压缩方法通常依赖预设的请求级预算,仅决定保留哪些 KV 状态,而 KV 总容量在整个解码过程中保持不变。然而,推理工作负载表现出显著的请求级需求变化:不同请求需要不同的 KV 容量,且单个请求的注意力需求在生成过程中会演变。我们提出了 **GrowPage**,一种按需 KV 预算框架,将 KV 容量视为运行时资源。GrowPage 维护轻量级的双时间尺度查询摘要,以捕捉近期和长期的注意力行为,并利用这些摘要估计需求演变。在每个容量边界,GrowPage 要么压缩当前分配内的 …