智迹闻AuraTracer
EN

EVENT DOSSIER

测量大语言模型性能波动:来自31,352次重复基准测试的测量结果及方法论 [D]

2026-09-07 15:44 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

一项针对大语言模型性能漂移的研究分析了 31,352 次重复基准测试观测数据。该研究将传统排行榜问题转变为纵向测量问题,旨在区分模型行为变化与基础设施波动。数据显示,同一天内分数的标准差为 2.80 分,而跨天每日中位数的标准差为 8.43 分,两者比例约为 3:1。研究团队采用版本化的基准配置、重复执行评估及变更检测等方法,并发布了包含测量设计但隐藏具体任务集的公开方法论文档。作者邀请同行就纵向评估的时间序列单位选择、漂移与基础设施效应的区分、基准污染控制及非平稳数据检测方法等提出批评与建议。

相关事件RELATED EVENTS

全部报道(1)SOURCES

R r/MachineLearning en 2026-09-07 15:44

测量大语言模型性能的变化:来自31,352次重复基准测试的测量结果及方法论 [D]

一项针对大语言模型性能漂移的研究分析了 31,352 次重复基准测试观测数据。该研究将基准测试从排行榜问题转变为纵向测量问题,旨在区分模型行为变化与基础设施波动。数据显示,同一天内分数的标准差为 2.80 分,而跨天每日中位数的标准差为 8.43 分,两者比例约为 3:1。研究团队采用版本化的基准配置、重复执行评估及变更检测等方法,并发布了包含测量设计但隐藏具体任务集的公开方法论文档。作者邀请同行就纵向评估的时间序列单位选择、漂移与基础设施效应的区分、基准污染控制及非平稳数据检测方法等提出批评与建议。