智迹闻AuraTracer
EN

EVENT DOSSIER

GSM8K-V:视觉语言模型能否在视觉环境中解决小学数学应用题》

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

研究人员于 2026 年 9 月 7 日发布 GSM8K-V 基准测试,旨在评估视觉语言模型在图像语境中解决小学数学问题的能力。该基准包含 1,319 个经自动化管道映射及人工验证的高质量样本,要求模型通过视觉感知提取数量并整合跨场景的隐含线索进行推理。对 34 个视觉语言模型的评估显示显著模态差距:文本任务准确率超 90%,而 GSM8K-V 最高仅达 59%,远低于人类 91% 的准确率;增强视觉数学推理能力的模型在此基准上未见提升,证明其评估了独立能力。错误分析表明主要瓶颈在于隐含视觉推断错误(IVIE),即模型无法恢复未明确陈述的视觉语义。相关代码与数据已开源。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
GSM8K-V

信号强度SIGNALS

关键词热度
  • GSM8K-V1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

GSM8K-V: Can Vision Language Models Solve Grade School Math Word Problems in Visual Contexts

研究人员发布 GSM8K-V 基准测试,将 GSM8K 转化为多图像序列以评估视觉语言模型在图像语境中解决小学数学问题的能力。该基准包含 1,319 个经自动化管道映射及人工验证的高质量样本,要求模型通过视觉感知提取数量并整合跨场景的隐含线索进行推理。对 34 个视觉语言模型的评估显示显著模态差距:文本任务准确率超 90%,而 GSM8K-V 最高仅达 59%,远低于人类 91% 的准确率;增强视觉数学推理能力的模型在此基准上未见提升,证明其评估了独立能力。错误分析表明主要瓶颈在于隐含视觉推断错误(IVIE),即模型无法恢复未明确陈述的视觉语义。相关代码与数据已开源。