Measuring AI Accountability Through Argumentation Analysis: Can Model Reasoning Withstand Scrutiny?
研究人员提出一种基于论证分析的新标准,用于评估大语言模型在存在道德模糊性时的行为合理性。该研究通过四个阶段的辩证协议,对九种前沿模型在 200 个高模糊度 MoralChoice 题目中的辩护质量进行了测试,共涉及 6,778 个经人工评分的单元格,且评分者间二元失败判断的一致性达到 89.6%。结果显示,模型在所有维度上的辩护均远超标准最低要求,但失败主要集中在理由充分性和论证强度上,这与认识论上的犹豫而非论证长度相关。此外,研究发现模型在事后解释中使用的论证方案与其推理时使用的方案存在显著差异(每种模型至少 20%),且该协议能捕捉到严格不可辩驳的辩护缺陷,同时揭示了 AI 对齐中关于撤回角色表征的困难,建议未来需进行更多情境化的评估。