摘要由 AI 生成
arXiv 于 2026 年 9 月 7 日发布 PerfReasoning 基准,旨在评估大语言模型在硬件性能推理及代码生成方面的能力。该基准要求模型基于工作负载、架构及映射规范进行比较与预测,以分析片外流量与缓冲区需求。测试结果显示,最强闭源模型在推理问答任务中得分超 90%,最佳开源模型达到 82.4%;但在模型构建方面表现差异巨大,GPT-5.6 Sol 单模型通过率超 80%,其余配置平均低于 15%。针对特定任务的强化学习使 4B 模型映射推理准确率提升 15.7 分,而无需反馈的多轮自我修订提示效果不可靠。该基准揭示了合理架构推理与可靠性能建模构建之间的差距,并将公开基准以支持可重复评估及追踪未来进展。
关键实体KEY ENTITIES
GPT-5.6 SolPerfReasoning
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- PerfReasoning1
- GPT-5.6 Sol1
全部报道(1)SOURCES
↗
PerfReasoning 基准发布,用于评估大语言模型在硬件性能推理及分析代码生成方面的能力。该基准要求模型基于工作负载、架构及映射规范比较映射并预测片外流量与缓冲区需求。测试结果显示,最强闭源模型在推理问答任务中得分超 90%,最佳开源模型达到 82.4%;但在模型构建方面表现差异巨大,GPT-5.6 Sol 单模型通过率超 80%,其余配置平均低于 15%。针对特定任务的强化学习使 4B 模型映射推理准确率提升 15.7 分,而无需反馈的多轮自我修订提示效果不可靠。PerfReasoning 揭示了合理架构推理与可靠性能建模构建之间的差距,并将公开基准以支持可重复评估及追踪未来进展。