智迹闻AuraTracer
EN

EVENT DOSSIER

语言模型能够控制自身的注意力 [R]

2026-09-05 14:07 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

研究团队提出 Declarative Attention(DA)协议,利用链式思维引导语言模型声明注意力区域。该协议将生成分为全局、聚焦和局部三种模式,使推理引擎跳过大部分 KV 缓存读取。在基于 Gemma-4-31B 和 Qwen-3.6-27B 的 15 个长上下文任务的零样本评估中,DA 显著减少了解码过程中的总关注 token 数量(分别为 52.0% 和 31.1%),但伴随轻微且随模型规模增大而缩小的准确率下降(分别为 1.27pp 和 2.75pp)。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Gemma-4-31BQwen-3.6-27B

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Gemma-4-31B × Qwen-3.6-…1

信号强度SIGNALS

关键词热度
  • Gemma-4-31B1
  • Qwen-3.6-27B1

全部报道(1)SOURCES

R r/MachineLearning en 2026-09-05 14:07

语言模型能够控制自身的注意力[R]

语言模型在长上下文对话中虽仅关注少量关键 token,却需扫描整个 KV 缓存。研究团队提出 Declarative Attention(DA)协议,利用链式思维引导模型声明注意力区域,将生成分为全局、聚焦和局部三种模式,使推理引擎跳过大部分 KV 缓存读取。在 15 个长上下文任务的零样本评估中,基于 Gemma-4-31B 和 Qwen-3.6-27B 的 DA 显著减少了解码过程中的总关注 token 数量(分别为 52.0% 和 31.1%),伴随轻微且随模型规模增大而缩小的准确率下降(分别为 1.27pp 和 2.75pp)。