智迹闻AuraTracer
EN

EVENT DOSSIER

拒绝不拒绝:对语言模型中安全调节响应的结构分析,以减少误拒情况

2026 年 9 月 7 日论文在 arXiv 及 Hugging Face Papers 发布

2026-09-07 12:00 大模型 🔥 47.2 事件热度
2家信源
1天持续发酵
47.2事件热度
2个提及
摘要由 AI 生成

2026 年 9 月 7 日,Minji Kim 与 Hyounghun Kim 在 arXiv 及 Hugging Face Papers 发表论文《Refuse without Refusal》,提出一种新的语言模型安全微调方法。研究指出,传统安全微调中使用的“标准拒绝陈述”会导致模型过度依赖表面特征(如关键词匹配),从而对看似有害实则良性的查询产生虚假拒绝。该研究将回复结构分解为“标准拒绝陈述”与“拒绝理由”两部分,发现仅基于“拒绝理由”进行训练,既能显著减少误拒现象,又能保持相当的安全性能。实验表明,该方法在指令微调(ICL)配置中同样有效,且兼容现有的推理时缓解方法。研究强调,构建包含细粒度安全监督数据的专用数据集,对于开发能更好平衡有用性与安全的对齐代理至关重要。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Hyounghun KimMinji Kim

事件框架EVENT FRAME

研究成果

政府 · 科研机构跨 1 天

当前状态

2026 年 9 月 7 日论文在 arXiv 及 Hugging Face Papers 发布

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Hyounghun Kim × Minji K…1

整合时间线UNIFIED TIMELINE

  1. 2026-09-07

    Refuse without Refusal 论文发布

    Minji Kim 与 Hyounghun Kim 在 arXiv 及 Hugging Face Papers 发表论文,提出将安全微调回复分解为‘标准拒绝陈述’与‘拒绝理由’两部分。研究发现仅基于理由训练可减少虚假拒绝并维持安全性能。

    2 条报道

信号强度SIGNALS

关键词热度
  • Minji Kim1
  • Hyounghun Kim1

全部报道(2)SOURCES

H Hugging Face Papers en 2026-09-07 08:00

Paper page - Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models

Minji Kim 和 Hyounghun Kim 发表的研究指出,安全微调回复中的标准拒绝陈述是导致语言模型产生虚假拒绝的主要驱动因素。该研究将回复分解为“标准拒绝陈述”和“解释理由”,发现前者使模型过度依赖“射击”等表面线索而非查询含义进行判断。仅基于理由进行训练可减少针对看似有害但无害查询的虚假拒绝,同时保持相当的安全性和通用能力,且该优势在上下文学习中持续有效,并与现有推理时缓解方法兼容。

A arXiv cs.AI en 2026-09-07 12:00

Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models

本文提出将安全微调数据中的回复分解为“标准拒绝陈述”与“拒绝理由”两部分,并发现仅基于理由进行训练可减少语言模型在区分有害与良性查询时的误拒现象,同时保持相当的安全性能。实验表明,标准拒绝陈述会诱导模型依赖表面特征,阻碍准确判别;而仅使用理由训练的效果在指令微调(ICL)配置中同样有效,且兼容现有推理时缓解方法。研究强调需要精心构建细粒度安全监督数据集,以开发更好地平衡有用性与安全的对齐代理。