智迹闻AuraTracer
EN

EVENT DOSSIER

基于底物感知的AI智能体:执行上下文作为一类输入

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
3个提及
摘要由 AI 生成

近期研究指出,人工智能代理若未获知运行环境(即“子基质盲”),将严重损害其执行能力。实验对比了 Anthropic Claude Opus 5、OpenAI GPT-5.6-Sol 和 Google Gemini 3.7 Flash 三个模型在仅接收任务描述与提供包含 128 MB RAM 及 10.0 秒墙时约束的执行上下文两种情况下的表现。结果显示,披露执行合同使峰值进程内存降低,平均墙时减少,执行速度最高提升 3.1 倍。在更严格的 96 MB 资源限制下,三个模型的正确且在预算内的结果分别为 4/5、5/5 和 3/5,而任务仅模式下的正确率均为 0/5 或 1/5。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Anthropic Claude Opus 5Google Gemini 3.7 FlashOpenAI GPT-5.6-Sol

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Anthropic Claude Opus 5…1Anthropic Claude Opus 5…1Google Gemini 3.7 Flash…1

信号强度SIGNALS

关键词热度
  • Anthropic Claude Opus 51
  • OpenAI GPT-5.6-Sol1
  • Google Gemini 3.7 Flash1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Substrate-Aware AI Agents: Execution Context as a First-Class Input

研究提出“执行上下文缺失”即"substrate blindness",并通过数值代码生成测试该命题。实验对比了 Anthropic Claude Opus 5、OpenAI GPT-5.6-Sol 和 Google Gemini 3.7 Flash 三个模型在仅接收任务描述与提供包含 128 MB RAM 及 10.0 s 墙时约束的执行上下文两种情况下的表现。披露执行合同使峰值进程内存降低,平均墙时减少,使执行速度最高提升 3.1 倍。在更严格的 96 MB 合同下,Claude Opus 5、GPT-5.6-Sol 和 Gemini 3.7 Flash 的正确且在预算内的结果分别为 4/5、5/5 和 3/5,而任务仅模式下的结果均为 0/5 或 1/5。最大 RSS 和墙时分别降低 49-74% 和 …