智迹闻AuraTracer
EN

EVENT DOSSIER

KVMem:在消费者 GPU 上虚拟化百万令牌的 Agent 工作区

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
4个提及
摘要由 AI 生成

KVMem 系统成功在消费级 GPU 上实现了百万级 token 的代理工作空间虚拟化。该系统通过将溢出历史以分页 KV 状态形式存储于 GPU、主机内存及 NVMe 中,并利用轻量级注意力空间索引来管理查询依赖。在 LongMemEval、MemoryAgentBench 和 AgentLongBench 等长上下文代理基准测试中,KVMem 相比主流压缩方法展现了更高的任务效用和推理效率。特别是在 DeepSWE 长上下文测试中,其任务成功率从使用压缩管理的 43.8% 提升至 48.4%。本地部署评估表明,该系统可在配备 24GB RTX 5090 Laptop GPU 的笔记本电脑上运行 Qwen3.6/3.8-27B NVFP4 模型,并支持虚拟化高达 1M token 的工作负载。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
KVMemQwen3.6/3.8-27BQwen3.8-27BRTX 5090

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
KVMem × Qwen3.6/3.8-27B1KVMem × Qwen3.8-27B1KVMem × RTX 50901Qwen3.6/3.8-27B × Qwen3…1Qwen3.6/3.8-27B × RTX 5…1Qwen3.8-27B × RTX 50901

信号强度SIGNALS

关键词热度
  • KVMem1
  • Qwen3.8-27B1
  • Qwen3.6/3.8-27B1
  • RTX 50901

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

KVMem: Virtualizing Million-Token Agent Workspaces on a Consumer GPU

KVMem 系统实现了在消费级 GPU 上虚拟化百万 token 代理工作空间。该系统将溢出历史以分页 KV 状态形式存储于 GPU、主机内存及 NVMe 中,利用轻量级注意力空间索引选择相关块并生成受模型原生上下文窗口限制的查询依赖执行视图。在涵盖 LongMemEval、MemoryAgentBench 和 AgentLongBench 等基准的长上下文代理测试中,KVMem 相比基于压缩的主流方法实现了更高的任务效用和推理效率;在 DeepSWE 长上下文测试中,其任务成功率从仅使用压缩管理的 43.8% 提升至 48.4%。本地部署评估显示,KVMem 可在配备 24GB RTX 5090 Laptop GPU 的笔记本电脑上运行 Qwen3.6/3.8-27B NVFP4 模型,虚拟化高达 1M t…