摘要由 AI 生成
2026 年 9 月 7 日,arXiv 发布了名为 RefactorPlatform 的开源评估工具,旨在为代码代理在跨文件重构任务中的设计选择提供隔离测试环境。该平台通过固定执行环境与显式控制模型架构(如 OpenRouter、GitHub Copilot CLI)、执行模式及提示词,支持工作区隔离运行、实时终端流监控、AST 验证及遥测数据导出,确保评估的可复现性与可审计性。在 RefactorBench 包含的 100 个多文件任务测试中,基于抽象语法树(AST)的分块策略比朴素分块提升了 25% 至 30%;检索增强模式虽增加 token 开销,但保持了单位重构成本不变;此外,轻量级单智能体配置在性能上优于子智能体配置。
关键实体KEY ENTITIES
GitHub Copilot CLIOpenRouterRefactorBenchRefactorPlatform
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- RefactorPlatform1
- OpenRouter1
- GitHub Copilot CLI1
- RefactorBench1
全部报道(1)SOURCES
↗
arXiv:2609.04898v1 发布开源评估工具 RefactorPlatform,用于隔离并测试代码代理在跨文件重构任务中的设计选择。该平台固定环境并显式控制模型架构(OpenRouter、GitHub Copilot CLI)、执行模式(基线、检索增强、多智能体)及提示词特异性,支持隔离工作区运行、实时终端流、AST 验证及可导出遥测数据。在 RefactorBench 100 个多文件任务上测试显示,基于 AST 的分块比朴素分块提升 25-30%,检索增强虽增加 token 开销但保持单位重构成本不变;且轻量级单智能体(86%)优于子智能体配置(66%)。RefactorPlatform 旨在使重构代理评估具备可复现性与可审计性。