智迹闻AuraTracer
EN

EVENT DOSSIER

超出注意力范围的定位与转向拒绝

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

研究提出在状态空间模型(SSM)等新型架构中,拒绝指令的安全表示具有跨架构迁移能力。实验发现,无论底层是 Transformer 还是 SSM,安全表征均由残差流中的单一方向决定,该方向仅改变空间朝向而不重塑结构,不同模型的表示空间可通过刚性旋转对齐。在 SSM 上训练的有害探测工具能准确识别攻击输入;移除对齐后的方向会使模型放弃原本拒绝的攻击,而随机方向效果微弱。控制实验证实,关键因素在于干预方向的估计位置(写点)而非应用位置。通过检测器触发的门控机制固定该方向强度,可在 SSM、Transformer、循环及混合四种架构中降低越狱成功率,且能抵御针对防御优化的攻击。结论表明,安全工具迁移至新架构无需重建,仅需在新架构的写点处重新估计该方向即可。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
arXiv

信号强度SIGNALS

关键词热度
  • arXiv1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

Locating and Steering Refusal Beyond Attention

本文提出,在状态空间模型(SSM)等新型架构中,拒绝指令的安全表示依然存在且可跨架构迁移。研究发现,无论底层是 Transformer 还是 SSM,安全表征均由残差流中的单一方向决定;该方向仅改变空间朝向而不重塑空间结构,因此不同模型的表示空间可通过刚性旋转对齐。实验表明,在 SSM 上训练的有害探测工具能准确识别其攻击输入,而移除对齐后的方向则使模型放弃原本拒绝的攻击,随机方向效果微弱。控制实验证实,关键因素在于干预方向的估计位置(即写点),而非应用位置;通过检测器触发的门控机制固定该方向强度,可在 SSM、Transformer、循环及混合四种架构中降低越狱成功率,且能抵御针对防御优化的攻击。结论指出,安全工具迁移至新架构无需重建,仅需在新架构的写点处重新估计该方向即可。