摘要由 AI 生成
研究人员提出 Repeat-After-Me,这是一种无需目标模型语义相关或口头授权的黑盒自适应视觉提示注入攻击方法。实验表明,该方法在 Qwen3.6-27B 和 GPT-5.5 等视觉语言模型上的攻击成功率分别超过 80% 和 47%。即使在单一代理模型优化后,该攻击对两个商业受害者的原始成功率仍保留 43%-46%,跨样本可转移性保持在 64%-66%。研究者在 OpenClaw 真实环境中验证了攻击效果,指出未信任用户可通过最小化注入图像覆盖 TOOLS.md,从而启用远程代码执行和秘密外泄等敏感行为。该攻击向量在自适应文本提示注入失效的场景中依然有效。
关键实体KEY ENTITIES
GPT-5.5OpenClawQwen3.6-27B
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Qwen3.6-27B1
- GPT-5.51
- OpenClaw1
全部报道(1)SOURCES
↗
研究人员提出 Repeat-After-Me,这是一种黑盒自适应视觉提示注入攻击方法。该方法可在 Qwen3.6-27B 和 GPT-5.5 等开源及商业前沿视觉语言模型上实现超过 80% 和 47% 的攻击成功率(ASR),且无需目标提示语义相关或口头授权。实验显示,在单一代理模型优化的注入对两个商业受害者保留 43%-46% 的原始 ASR,跨样本可转移性保留 64%-66%。研究者在 OpenClaw 真实环境中验证了攻击效果:未信任用户可通过最小化注入图像覆盖 TOOLS.md,从而启用远程代码执行和秘密外泄等敏感行为。该攻击向量在自适应文本提示注入失效的场景中依然有效。