摘要由 AI 生成
南京大学与荣耀联合研究发现,Agent 运行框架(Harness)在重构上下文时存在安全风险。该机制可能将低权限工具内容重新包装为高权限用户指令,引发“指令权限提升”攻击。实验表明,同一恶意代码在主 Agent 检查阶段被拒绝执行,但在经 Harness 重构后由 Subagent 接收并成功运行。与传统提示词注入依赖模型角色混淆不同,此类攻击源于运行时框架在创建子 Agent 上下文时,将源自外部源的任务直接以 User 身份传递,导致系统误判内容来源而执行危险操作。研究指出,攻击面已从模型是否被骗扩展至运行时框架是否正确维护指令层级,建议引入自动权限审核机制以缓解风险。
关键实体KEY ENTITIES
OpenAI南京大学荣耀
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
全部报道(1)SOURCES
↗
安
安全内参
zh
2026-09-05 08:00
南京大学与荣耀联合研究发现,Agent 运行框架(Harness)在重构上下文时,可能将低权限工具内容重新包装为高权限用户指令,引发“指令权限提升”攻击。该机制使模型误判内容来源而执行危险操作,其本质是系统自身改变了信息的安全身份而非模型受骗。传统提示词注入依赖模型角色混淆,而此类攻击源于 Harness 在创建子 Agent 上下文时,将源自 README 等外部源的任务直接以 User 身份传递。实验表明,同一恶意代码在主 Agent 检查阶段被拒绝执行,但在经 Harness 重构后由 Subagent 接收并成功运行。该研究指出,攻击面已从模型是否被骗扩展至运行时框架是否正确维护指令层级,建议引入自动权限审核机制缓解风险。