智迹闻AuraTracer
EN

EVENT DOSSIER

AI模型在这些智力测试中表现不佳。你能做得更好吗?

2026-08-26 17:00 大模型 🔥 26.9 事件热度
1家信源
1天持续发酵
26.9事件热度
4个提及
摘要由 AI 生成

尽管人工智能在逻辑谜题和视觉推理方面取得快速进展,但在空间推理、记忆适应性及抽象视觉推理等特定领域表现仍弱于人类。哥伦比亚大学研究数据显示,AI 对《纽约时报》Connections 谜题的解决能力虽从 2024 年末至 2025 年初提升至近乎完美,但 Google 与伊利诺伊大学厄巴纳 - 香槟分校的研究指出,模型在处理类似训练数据的骑士与无赖谜题时,易因过度依赖记忆而忽略细微差异。SimpleBench 测试进一步证实了此类问题对顶级模型的挑战。此外,AI 在三维及二维空间推理任务上远逊于人类建筑师或机械工程师,且在 ARC-AGI 等基准测试中难以从示例推断抽象规则。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Arthur SamuelColumbia UniversityIBMNew York Times

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Arthur Samuel × Columbi…1Arthur Samuel × IBM1Arthur Samuel × New Yor…1Columbia University × I…1Columbia University × N…1IBM × New York Times1

信号强度SIGNALS

关键词热度
  • IBM1
  • Arthur Samuel1
  • Columbia University1
  • New York Times1

全部报道(1)SOURCES

M MIT Tech Review AI en 2026-08-26 17:00

人工智能模型在这些智力测试中频频出错。你能做得更好吗?

人工智能模型在智力测试中表现不佳。尽管 AI 在逻辑谜题和视觉推理方面进步迅速,但在空间推理、记忆适应性及抽象视觉推理等特定领域仍显薄弱。哥伦比亚大学研究团队数据显示,2024 年末至 2025 年初,AI 对《纽约时报》Connections 谜题的解决能力从 18% 提升至近乎完美。Google 与伊利诺伊大学厄巴纳 - 香槟分校的研究表明,模型在类似训练数据的骑士与无赖谜题中易因过度依赖记忆而忽略细微差异;SimpleBench 测试也证实了此类问题对顶级模型的挑战。此外,AI 在三维及二维空间推理任务上远逊于人类建筑师或机械工程师,且在 ARC-AGI 等基准测试中难以从示例推断抽象规则。