The Struggle Between Continuation and Refusal: A Mechanistic Analysis of the Continuation-Triggered Jailbreak in LLMs
研究人员针对大语言模型(LLMs)中因指令后缀位置移动而显著增加越狱成功率的现象,提出了“头竞争转向”(Head Competition Steering, HCS)策略。该研究通过注意力头层面的因果干预和激活缩放分析,发现越狱行为源于模型内在续写驱动与安全对齐防御之间的固有竞争。基于此机制,HCS 利用安全头与续写头的竞争抑制有害生成,并通过知识蒸馏将其信号迁移至学生模型,实现了无需额外计算开销的推理时安全性提升。