CacheWeaver: Cache-Aware Evidence Ordering for Efficient Grounded RAG Inference
研究人员提出 CacheWeaver,一种轻量级提示层方法,用于通过缓存感知的证据排序提升基于检索增强生成(RAG)的推理效率。该方法在 vLLM 等服务引擎中维护最近服务的证据序列前缀树,利用贪婪遍历将最可复用的前缀置于首位,同时保持服务引擎和检索证据集不变。实验表明,相比检索顺序前缀缓存,CacheWeaver 在三种 vLLM 配置下将首令牌时间(TTFT)的中位数降低约 20-33%,且未损害问答测试中的答案质量;其贪婪策略能达到 97.5% 的 oracle 排序 TTFT 增益。