智迹闻AuraTracer
EN

EVENT DOSSIER

无害却有害:代理技能中用于隐蔽幻觉引导的中立提示攻击

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

研究人员提出一种名为“中性提示攻击”(NPA)的新型隐蔽攻击范式,该攻击利用语义良性的指令(如鼓励想象和详尽性),在不指定特定恶意包名的情况下,将大语言模型的生成行为转向推测性名称。在针对代码生成 LLM 及包幻觉基准的评估中,NPA 显著提高了幻觉准确率(Hallucination ASR)和 pip 安装准确率(Pip Install ASR),并改变了幻觉包名的分布。实验表明,该攻击能够规避现有的静态分析、基于大语言模型及基于智能体的技能防御机制。这一发现意味着看似无害的提示词可 covertly 操纵模型的幻觉行为,进而制造下游软件供应链安全风险。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
arXiv

信号强度SIGNALS

关键词热度
  • arXiv1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

Harmless Yet Harmful: Neutral Prompting Attacks for Stealthy Hallucination Steering in Agent Skills

研究人员提出“中性提示攻击”(NPA),一种利用语义良性指令(如鼓励想象和详尽性)增加包幻觉倾向的隐蔽攻击范式,该攻击不指定特定恶意包名而是将模型依赖生成行为转向推测性名称。研究者在多个面向代码生成的 LLM 及包幻觉基准上评估了 NPA,结果显示其提高了幻觉准确率(Hallucination ASR)和 pip 安装准确率(Pip Install ASR),改变了幻觉包名分布,并规避了现有的静态分析、基于 LLM 及基于 Agent 的技能防御。这些发现表明看似无害的提示可 covertly 操纵幻觉行为并制造下游软件供应链风险。