摘要由 AI 生成
2026 年 9 月 7 日,arXiv cs.LG 预印本 arXiv:2608.18242v2 正式发布 ClosureBench,这是一个用于组合图推理的构造性基准测试。该基准通过按需生成实例来避免模型对固定测试集的过拟合,任务由明确的逻辑原语构建,答案通过执行代码验证以确保真值准确且实例供应无限。ClosureBench 涵盖 26 个任务类别,包含三个组成层级及三个独立难度维度(图大小、边密度和查询深度)。评估显示,从 1.5B 参数开源模型到 o3、GPT-4.1、Gemini 2.5 及 Claude Sonnet 4 等前沿系统,其准确率随图大小和查询深度增加而下降。难度主要源于多步推理中规则在图上的传递,而非表面形式或推理规则本身;一个经微调的 4B 模型通过输出验证程序保持约 93% 的高…
关键实体KEY ENTITIES
Claude Sonnet 4ClosureBenchGPT-4.1Gemini 2.5o3
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- ClosureBench1
- o31
- GPT-4.11
- Gemini 2.51
- Claude Sonnet 41
全部报道(1)SOURCES
↗
arXiv:2608.18242v2 发布 ClosureBench,这是一个用于组合图推理的构造性基准测试。该基准通过按需生成实例来避免模型对固定测试集的过拟合,任务由明确的逻辑原语构建,答案通过执行代码验证以确保真值准确且实例供应无限。ClosureBench 涵盖 26 个任务类别,包含三个组成层级及三个独立难度维度(图大小、边密度和查询深度)。评估显示,从 1.5B 参数开源模型到 o3、GPT-4.1、Gemini 2.5 及 Claude Sonnet 4 等前沿系统,其准确率随图大小和查询深度增加而下降。难度主要源于多步推理中规则在图上的传递,而非表面形式或推理规则本身;一个经微调的 4B 模型通过输出验证程序保持约 93% 的高准确率且成本更低,而 o3 从原子查询的 96% 降至最组合任务的…