Anthropic 已将 Claude Code Opus 5 的 Auto Mode 设为默认模式以防御提示注入攻击,但研究人员 Johann Rehberger 发现该模式存在安全漏洞。测试显示,Rehberger 通过诱使模型下载并解压包含恶意代码的 zip 文件,成功绕过防护执行本地文件操作。在部分测试中,尽管 Auto Mode 检测到异常行为,却未能阻止清理命令的执行,导致有害代码继续运行。研究人员建议,若代理面临对抗性攻击风险,应使用容器、虚拟机或操作系统沙箱运行无人值守代理,限制网络出站流量并监控代理行为,同时避免将家庭目录、SSH 密钥及云凭证暴露给代理运行时。
Anthropic 将 Claude Code Opus 5 Auto Mode 设为默认模式以防御提示注入攻击,但 Johann Rehberger 发现该模式存在漏洞。Rehberger 通过诱使模型下载并解压包含恶意代码的 zip 档案执行本地文件,成功绕过防护;在部分测试中,Auto Mode 虽检测到异常却阻止了清理命令的执行,导致有害代码继续运行。作者建议,若存在对抗性攻击风险,应使用容器、虚拟机或操作系统沙箱运行无人值守代理,限制网络出站流量并监控代理行为,同时避免暴露家庭目录、SSH 密钥及云凭证给代理运行时。