智迹闻AuraTracer
EN

EVENT DOSSIER

KCSAT-ML:利用全国范围内的人群难度来探究推理模型』

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
3个提及
摘要由 AI 生成

研究人员于 2026 年 9 月推出 KCSAT-ML 基准测试,该数据集涵盖韩国大学入学能力考试(KCSAT)2014 至 2025 年的 664 道数学题及官方错误率。配套引入难度对齐推理增益(DRG)指标,用于评估模型错误是否集中在人类认为困难的题目上。实验发现三种模式:低预算模型在人类高错误率尾部准确率崩溃;测试时缩放使 token 使用与人群错误率呈线性增长,而准确率提升呈非单调曲线;同一模型家族内,测试时缩放在最难题目上表现为反缩放,在简单题目上表现为过度思考。DRG 指标显示,准确率相近的模型可能在 DRG 值上截然相反:一个模型错在人类也认为难的题,另一个则解出难题却错在人认为简单的题。相关代码与数据集构建工具已开源。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
KCSAT-MLKorean College Scholastic Ability TestNaver AI

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
KCSAT-ML × Korean Colle…1KCSAT-ML × Naver AI1Korean College Scholast…1

信号强度SIGNALS

关键词热度
  • KCSAT-ML1
  • Naver AI1
  • Korean College Scholastic Ability Test1

全部报道(1)SOURCES

A arXiv cs.CL en 2026-09-07 12:00

KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty

研究人员推出 KCSAT-ML 基准测试,该数据集包含韩国大学入学能力考试(KCSAT)2014 至 2025 年共 664 道数学题及官方错误率。配套引入难度对齐推理增益(DRG)指标,用于评估模型错误是否集中在人类认为困难的题目上。实验发现三个模式:低预算模型在人类高错误率尾部准确率崩溃;测试时缩放使 token 使用与人群错误率呈线性增长,而准确率提升呈非单调曲线;同一模型家族内,测试时缩放在最难题目上表现为反缩放,在简单题目上表现为过度思考。DRG 指标显示,准确率相近的模型可能在 DRG 值上截然相反:一个模型错在人类也认为难的题,另一个则解出难题却错在人认为简单的题。相关代码与数据集构建工具已开源。