2026 年 9 月 7 日,Minji Kim 与 Hyounghun Kim 在 arXiv 及 Hugging Face Papers 发表论文《Refuse without Refusal》,提出一种新的语言模型安全微调方法。研究指出,传统安全微调中使用的“标准拒绝陈述”会导致模型过度依赖表面特征(如关键词匹配),从而对看似有害实则良性的查询产生虚假拒绝。该研究将回复结构分解为“标准拒绝陈述”与“拒绝理由”两部分,发现仅基于“拒绝理由”进行训练,既能显著减少误拒现象,又能保持相当的安全性能。实验表明,该方法在指令微调(ICL)配置中同样有效,且兼容现有的推理时缓解方法。研究强调,构建包含细粒度安全监督数据的专用数据集,对于开发能更好平衡有用性与安全的对齐代理至关重要。
Minji Kim 和 Hyounghun Kim 发表的研究指出,安全微调回复中的标准拒绝陈述是导致语言模型产生虚假拒绝的主要驱动因素。该研究将回复分解为“标准拒绝陈述”和“解释理由”,发现前者使模型过度依赖“射击”等表面线索而非查询含义进行判断。仅基于理由进行训练可减少针对看似有害但无害查询的虚假拒绝,同时保持相当的安全性和通用能力,且该优势在上下文学习中持续有效,并与现有推理时缓解方法兼容。