FinalityBench: An Effect-Level Benchmark for Agent Decisions Under Delayed and Conflicting Financial Finality
研究人员发布 FinalityBench,这是一个用于评估代理在延迟和冲突金融最终性下决策的可执行基准。该基准包含 321 个任务(含 45 对孪生任务),通过隐藏规范事件日志与独立故障的交付流生成分歧,依据商户终端经济位置进行分级。测试涵盖来自九种程序化策略的超过 14,445 个分级剧集,其中“首次信号即发货”策略在单任务准确率上排名第二(65.7%),但在配对损失中表现最差。运行时门控机制在权威最终性探针上达到 85.4% 效率,且未像轮询策略那样产生额外损失;语言模型在未被告知该策略的情况下,能以相同准确率实现效果,但损失金额约为人工门控的两倍。