Recurrence Is Not Enough: Causally Validating Multilingual SAE Translation Features in Gemma 2 and 3
研究人员在 Gemma 2 和 Gemma 3 模型中复现并扩展了 Wu et al. (2026) 的稀疏自编码器(SAE)特征发现方法,以验证翻译启动特征在多语言环境下的因果作用。测试显示,尽管两个模型均发现了超过 20 个跨设置频繁激活的特征,但因果验证表明这些特征对翻译行为的影响微小或不一致;唯有 Gemma 2 的 (L10, 5717) 和 Gemma 3 的 (L20, 2456) 一个特征在 23 种语言设置中表现一致:放大其激活可提升 COMET 评分,抑制则降低评分。研究结果表明,特征重复现象会高估跨语言迁移能力,同时识别了 Gemma 2 和 Gemma 3 中通用的翻译启动方向。