智迹闻AuraTracer
EN

EVENT DOSSIER

FinalityBench:一种用于评估延迟且存在冲突的财务结果下代理决策效果的水平基准测试

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

研究人员发布了 FinalityBench,这是一个用于评估智能代理在延迟和冲突金融最终性环境下做出决策的可执行基准测试。该基准包含 321 个任务(含 45 对孪生任务),通过隐藏规范事件日志与独立故障的交付流来生成分歧,并依据商户终端经济位置进行分级。测试涵盖了来自九种程序化策略的超过 14,445 个分级剧集。结果显示,“首次信号即发货”策略在单任务准确率上排名第二(65.7%),但在配对损失中表现最差。运行时门控机制在权威最终性探针上达到了 85.4% 的效率,且未像轮询策略那样产生额外损失。此外,语言模型在未被告知该策略的情况下,能以相同的准确率实现效果,但产生的损失金额约为人工门控的两倍。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
FinalityBench

信号强度SIGNALS

关键词热度
  • FinalityBench1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

FinalityBench: An Effect-Level Benchmark for Agent Decisions Under Delayed and Conflicting Financial Finality

研究人员发布 FinalityBench,这是一个用于评估代理在延迟和冲突金融最终性下决策的可执行基准。该基准包含 321 个任务(含 45 对孪生任务),通过隐藏规范事件日志与独立故障的交付流生成分歧,依据商户终端经济位置进行分级。测试涵盖来自九种程序化策略的超过 14,445 个分级剧集,其中“首次信号即发货”策略在单任务准确率上排名第二(65.7%),但在配对损失中表现最差。运行时门控机制在权威最终性探针上达到 85.4% 效率,且未像轮询策略那样产生额外损失;语言模型在未被告知该策略的情况下,能以相同准确率实现效果,但损失金额约为人工门控的两倍。