摘要由 AI 生成
针对低比特键值缓存(KV Caches)导致的自回归解码质量损失问题,研究人员提出通过低秩 Q/K/V 投影更新蒸馏浮点缓存模型行为,并结合学生执行物理打包增量缓存。在 TinyLlama-1.1B 和 Gemma-4-12B 模型上,4 位仿射缓存适配器分别恢复了 $54.24\%\pm2.47\%$ 和 $75.96\%\pm4.04\%$ 的测试 perplexity 差距。在冻结的 NF4 Llama-3.1-8B 基座上,特定量化器下的恢复率分别为 $60.42\%$ 和 $37.61\%$,同时保持了 180 个关联检索案例。此外,Gemma 模型在官方 4K/8K RULER 子集上的分数从适配前的 42.80 提升至适配后的 48.33。
关键实体KEY ENTITIES
Gemma-4-12BLlama-3.1-8BTinyLlama-1.1B
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- TinyLlama-1.1B1
- Gemma-4-12B1
- Llama-3.1-8B1
全部报道(1)SOURCES
↗
低比特键值缓存(KV Caches)虽能减少自回归解码内存占用,但会导致质量损失。本研究提出通过低秩 Q/K/V 投影更新蒸馏浮点缓存模型行为,同时学生执行物理打包增量缓存。在 TinyLlama-1.1B 和 Gemma-4-12B 上,4 位仿射缓存适配器分别恢复 $54.24\%\pm2.47\%$ 和 $75.96\%\pm4.04\%$ 的测试 perplexity 差距;在冻结的 NF4 Llama-3.1-8B 基座上,特定量化器下恢复率分别为 $60.42\%$ 和 $37.61\%$,同时保持 180 个关联检索案例。Gemma 在官方 4K/8K RULER 子集上的分数从未适配的 42.80 提升至适配后的 48.33。此外,2 位秩 - 令牌扫描将 TinyLlama 的 2 位 pe…