摘要由 AI 生成
研究人员于 2026 年 9 月推出 KCSAT-ML 基准测试,该数据集涵盖韩国大学入学能力考试(KCSAT)2014 至 2025 年的 664 道数学题及官方错误率。配套引入难度对齐推理增益(DRG)指标,用于评估模型错误是否集中在人类认为困难的题目上。实验发现三种模式:低预算模型在人类高错误率尾部准确率崩溃;测试时缩放使 token 使用与人群错误率呈线性增长,而准确率提升呈非单调曲线;同一模型家族内,测试时缩放在最难题目上表现为反缩放,在简单题目上表现为过度思考。DRG 指标显示,准确率相近的模型可能在 DRG 值上截然相反:一个模型错在人类也认为难的题,另一个则解出难题却错在人认为简单的题。相关代码与数据集构建工具已开源。
关键实体KEY ENTITIES
KCSAT-MLKorean College Scholastic Ability TestNaver AI
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- KCSAT-ML1
- Naver AI1
- Korean College Scholastic Ability Test1
全部报道(1)SOURCES
↗
研究人员推出 KCSAT-ML 基准测试,该数据集包含韩国大学入学能力考试(KCSAT)2014 至 2025 年共 664 道数学题及官方错误率。配套引入难度对齐推理增益(DRG)指标,用于评估模型错误是否集中在人类认为困难的题目上。实验发现三个模式:低预算模型在人类高错误率尾部准确率崩溃;测试时缩放使 token 使用与人群错误率呈线性增长,而准确率提升呈非单调曲线;同一模型家族内,测试时缩放在最难题目上表现为反缩放,在简单题目上表现为过度思考。DRG 指标显示,准确率相近的模型可能在 DRG 值上截然相反:一个模型错在人类也认为难的题,另一个则解出难题却错在人认为简单的题。相关代码与数据集构建工具已开源。