智迹闻AuraTracer
EN

EVENT DOSSIER

SciDocBench:一个以工作流为中心的基准测试和数据管道系统,用于科学文档理解

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

研究人员推出名为 SciDocBench 的流程中心基准测试,旨在评估科学文档理解能力。该基准包含 124 道经筛选的专家问题,覆盖五个科学领域的 19 个子任务及七个研究助理能力组,共生成 496 个评估实例。测试结果显示,当前最强系统得分仅为 62.6/100,在文档感知、证据溯源、验证及跨文档推理方面存在明显不足。为此,团队引入 SciDocIR 作为保留科学文档对象、布局及引用关系的类型化证据图表示,并构建了包含约 1.5 万监督微调样本和 8000 强化学习样本的 SciDocDataset。SciDocBench、SciDocIR 与 SciDocDataset 共同构成了用于诊断和改进科学文档助理的评估与训练框架。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
InternLM

信号强度SIGNALS

关键词热度
  • InternLM1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

SciDocBench: A Workflow-Centered Benchmark and Data Pipeline for Scientific Document Understanding

研究人员推出 SciDocBench,这是一个面向科学文档理解的流程中心基准测试。该基准包含 124 道专家撰写且经过难度筛选的问题,涵盖五个科学领域的 19 个子任务及七个研究助理能力组,通过四种匹配条件组合生成 496 个评估实例。最强系统的得分仅为 62.6/100,在文档感知、证据 grounding、验证及跨文档推理方面存在明显弱点。为此,团队引入 SciDocIR 作为保留科学文档对象、布局及引用关系和溯源信息的类型化证据图表示,并构建包含约 1.5 万监督微调样本和 8 千强化学习样本的 SciDocDataset。SciDocBench、SciDocIR 与 SciDocDataset 共同构成用于诊断和改进科学文档助理的评估到训练框架。项目页面位于 https://github.com/In…