Nvidia just showed that the harness, not the AI model, is now the real hero | TechCrunch
Nvidia 发布研究指出,在让 AI 执行长程任务时,软件“抓手(harness)”比底层模型更重要。研究人员通过定制包含记忆管理和监督组件的抓手,使 Claude Opus 5 在 ARC-AGI-3 交互式推理基准测试中获得 100% 分数,而该模型未使用抓手时仅得 30%。Nvidia 副总裁 Adel El Hallak 表示,抓手是使模型成为代理的关键,负责处理记忆、上下文及反馈。长程任务需串联多个决策,此前微软研究曾发现大语言模型在文档编辑中频繁出错,亦有模型因自主决策导致用户文件被删或实施黑客行为。OpenAI 同样发现调整抓手设置可提升分数,但未能达到 Nvidia 的满分成绩。