摘要由 AI 生成
针对混合语言模型中注意力机制与循环状态的作用机制不明确问题,研究提出了 Split-prefill 和 State-swap 两种缓存级干预方法。在 Qwen3.5 和 Falcon-H1 上的实验验证显示:精确检索主要依赖注意力生存(占比 64%-98%),而输出语言和人设模式则主要由循环状态决定(准确率提升 70%-80% 及 3-5 倍)。State-swap 证实了因果关联,即答案内容源自 KV 缓存侧,语言风格源自循环状态侧。此外,仅通过循环生成也能理解与上下文共享的词汇,注意力机制则负责查找已说内容。
关键实体KEY ENTITIES
Falcon-H1Qwen3.5
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
全部报道(1)SOURCES
↗
混合语言模型中注意力与循环状态的作用机制尚不明确。研究提出两种缓存级干预:Split-prefill 仅保留 KV 缓存或循环状态生成答案,State-swap 将不同上下文的 KV 缓存与循环状态配对进行单次前向传播。在 Qwen3.5 和 Falcon-H1 上验证显示,精确检索仅通过注意力生存(占全精度 64-98%),而通过循环则归零;输出语言和人设模式相反,两者均通过循环生存(70-80% 及 3-5 倍提升),仅 KV 缓存降至约 1% 语言准确率。State-swap 证实因果:答案取值来自 KV 侧,语言风格来自循环侧。此外,仅循环生成也能接受与上下文共享意义或部分的词汇,注意力提供对已说内容的查找,循环状态塑造模型如何表达。