Locating and Steering Refusal Beyond Attention
本文提出,在状态空间模型(SSM)等新型架构中,拒绝指令的安全表示依然存在且可跨架构迁移。研究发现,无论底层是 Transformer 还是 SSM,安全表征均由残差流中的单一方向决定;该方向仅改变空间朝向而不重塑空间结构,因此不同模型的表示空间可通过刚性旋转对齐。实验表明,在 SSM 上训练的有害探测工具能准确识别其攻击输入,而移除对齐后的方向则使模型放弃原本拒绝的攻击,随机方向效果微弱。控制实验证实,关键因素在于干预方向的估计位置(即写点),而非应用位置;通过检测器触发的门控机制固定该方向强度,可在 SSM、Transformer、循环及混合四种架构中降低越狱成功率,且能抵御针对防御优化的攻击。结论指出,安全工具迁移至新架构无需重建,仅需在新架构的写点处重新估计该方向即可。