智迹闻AuraTracer
EN

EVENT DOSSIER

相同的请求,不同的答案:量化技术会加剧LLM服务过程中由缓存引起的偏差

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

一项针对大语言模型服务的最新研究证实,量化操作会显著加剧由缓存机制引发的执行结果不可复现问题。研究人员在固定模型、解码参数、随机种子及请求顺序的条件下,对比测试了两种引擎与四种权重格式下的代理工具使用工作负载。实验结果显示,启用缓存后,16 位精度下约 36.2% 的回合中代理轨迹发生改变,而 4 位精度下该比例激增至 75.0%;相比之下,禁用缓存时所有执行结果完全一致。研究定位到三个关键原因:单个服务器级提示词缓存设置将运行间差异扩大 37.5 个百分点,且仅在执行顺序设置激活时才生效;此外,恢复缓存状态后,缓存路径与重算路径虽各自可复现但结果相互不同。研究指出,尽管给定特定缓存状态下服务是确定性的,但由于请求中不包含该状态且默认不重置,导致实际运行不可复现,同时单轮测试表明这种发散已影响具体任务结果而不…

相关事件RELATED EVENTS
关键实体KEY ENTITIES
arXiv

信号强度SIGNALS

关键词热度
  • arXiv1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

Same Request, Different Answer: Quantization Amplifies Cache-Induced Divergence in LLM Serving

一项针对大语言模型服务的研究证实,量化会显著加剧由缓存引起的不可复现性。研究人员在固定模型、解码参数、种子及请求顺序的条件下,使用两个引擎和四种权重格式运行了 80 个回合的代理工具使用工作负载。结果显示,启用缓存后,16 位精度下 36.2% 的回合中代理轨迹发生改变,而 4 位精度下该比例升至 75.0%;禁用缓存时所有执行结果完全一致。实验定位到三个原因:单个服务器级提示词缓存设置将运行间差异扩大 37.5 个百分点,执行顺序仅在设置激活时生效,且恢复缓存状态后缓存与重算路径虽各自可复现但仍相互不同。研究指出,给定缓存状态缓存服务是确定性的,但因请求中不包含该状态且默认不重置,导致实际不可复现,同时单轮测试表明这种发散已影响任务结果而不改变整体准确率。