Paper page - What Else Needs Fixing? Exploring Cost-Effective Test-Time Compute for Revision Propagation in Artifacts Generated Through Conversation
Daisuke Kikuta 提出 RevPropBench,用于评估大语言模型在对话生成 JSON 制品时传播局部修订的能力。该基准通过 LLM 合成采样与人工标注构建样本,并考察了成本有效的测试时间计算策略。研究对比了九种修订方法,包括顺序反思和平行采样变体,使用 gpt-oss-20b/120b、gpt-5.4-mini 及 qwen3.5-9b/27b/122b 模型进行评测。结果显示基线准确率在 68.3% 至 93% 之间,其中从三个并行采样中选取的方法最为成本有效。