Moral Competence Before Moral Content: Why LLM Agents Lack the Prerequisites for Coherent Alignment
AI 对齐研究提出,基于大语言模型(LLM)的代理因缺乏结构性的道德能力而无法实现一致的对齐。研究者定义了包括裁决稳定性、单调性、决断力和帕累托可行性在内的四项结构性条件,以此衡量无需依赖道德标准即可评估的行为一致性。在针对九个前沿模型的三项模拟部署测试中,结果显示没有任何模型表现出跨场景的一致性政策:仅表面形式扰动即可导致裁决率波动高达 99 个百分点,且单一场景的成功无法预测其他场景的能力。这表明当前基于 LLM 的代理尚不具备可被对齐技术有效应用的属性。