TruthInsightBench: An Evidence-Grounded Benchmark for Automated Evaluation of Open-Ended Scientific Discovery Agents
TruthInsightBench 是一个用于自动化评估开放科学发现代理的证据 grounded 基准,包含从 10 个科学领域 40 篇同行评审研究中抽取的 40 个盲测任务。该基准仅提供中性科学目标和冻结数据,隐藏源结论、预期值和分析路径,要求代理自行确定数据支持的声明。固定 LLM 基于法官依据六个维度操作化的 29 个基于工件的项目对代理声明的证据成熟度进行评分,采用自动化确定性聚合且无人工分级。在一台冻结基础模型上,四个编码代理得分在 58.4 至 60.3 分之间(满分 100),无统计学显著差异;它们虽能胜任分析执行与文档编写,具备较强的证据可审计性和新颖性,但缺乏建立可信声明所需的区分性行为(如控制、稳健性、可证伪性及跨数据集泛化)。瓶颈在于科学判断而非编码,真实发现仍难以企及。TruthIn…