SharedSAE:跨语言模型的统一特征词典
研究人员提出 SharedSAE 方法,通过共享字典与模型专用编解码器对,替代传统为每个语言模型单独训练 SAE 的做法。该方法在四个不同家族和分词器的 1B 规模基础语言模型上进行训练。实验显示,SharedSAE 保留了 96.6% 的专一 SAE 平均解释方差,其潜在激活与分别对齐后 SAE 的跨模型相关性高出 1.8 倍,且潜在描述可在模型间迁移。冻结字典后,新模型可高效适配并实现接近专一 SAE 的重建质量。
EVENT DOSSIER
研究人员提出 SharedSAE 方法,旨在解决传统为每个语言模型单独训练稀疏自动编码器(SAE)效率低下的问题。该方法采用共享特征字典结合模型专用编解码器对的设计,在四个不同家族及分词器的 10 亿参数基础语言模型上进行验证。实验表明,SharedSAE 保留了 96.6% 的专一 SAE 平均解释方差,其潜在激活与分别对齐后 SAE 的跨模型相关性高出 1.8 倍,且潜在描述具备跨模型迁移能力。在冻结字典的情况下,新模型可高效适配并实现接近专一 SAE 的重建质量。
研究人员提出 SharedSAE 方法,通过共享字典与模型专用编解码器对,替代传统为每个语言模型单独训练 SAE 的做法。该方法在四个不同家族和分词器的 1B 规模基础语言模型上进行训练。实验显示,SharedSAE 保留了 96.6% 的专一 SAE 平均解释方差,其潜在激活与分别对齐后 SAE 的跨模型相关性高出 1.8 倍,且潜在描述可在模型间迁移。冻结字典后,新模型可高效适配并实现接近专一 SAE 的重建质量。