摘要由 AI 生成
KVMem 系统成功在消费级 GPU 上实现了百万级 token 的代理工作空间虚拟化。该系统通过将溢出历史以分页 KV 状态形式存储于 GPU、主机内存及 NVMe 中,并利用轻量级注意力空间索引来管理查询依赖。在 LongMemEval、MemoryAgentBench 和 AgentLongBench 等长上下文代理基准测试中,KVMem 相比主流压缩方法展现了更高的任务效用和推理效率。特别是在 DeepSWE 长上下文测试中,其任务成功率从使用压缩管理的 43.8% 提升至 48.4%。本地部署评估表明,该系统可在配备 24GB RTX 5090 Laptop GPU 的笔记本电脑上运行 Qwen3.6/3.8-27B NVFP4 模型,并支持虚拟化高达 1M token 的工作负载。
关键实体KEY ENTITIES
KVMemQwen3.6/3.8-27BQwen3.8-27BRTX 5090
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- KVMem1
- Qwen3.8-27B1
- Qwen3.6/3.8-27B1
- RTX 50901
全部报道(1)SOURCES
↗
KVMem 系统实现了在消费级 GPU 上虚拟化百万 token 代理工作空间。该系统将溢出历史以分页 KV 状态形式存储于 GPU、主机内存及 NVMe 中,利用轻量级注意力空间索引选择相关块并生成受模型原生上下文窗口限制的查询依赖执行视图。在涵盖 LongMemEval、MemoryAgentBench 和 AgentLongBench 等基准的长上下文代理测试中,KVMem 相比基于压缩的主流方法实现了更高的任务效用和推理效率;在 DeepSWE 长上下文测试中,其任务成功率从仅使用压缩管理的 43.8% 提升至 48.4%。本地部署评估显示,KVMem 可在配备 24GB RTX 5090 Laptop GPU 的笔记本电脑上运行 Qwen3.6/3.8-27B NVFP4 模型,虚拟化高达 1M t…