智迹闻AuraTracer
EN

EVENT DOSSIER

《了解不应回答的问题:视觉语言模型中的选择性不服从行为》

KoNA 基准发布,揭示视觉语言模型在特定场景下存在选择性不合规缺陷。

2026-09-07 12:00 大模型 🔥 47.2 事件热度
2家信源
1天持续发酵
47.2事件热度
5个提及
摘要由 AI 生成

2026 年 9 月 7 日,研究人员发布 KoNA 基准,旨在评估视觉语言模型在错误前提、视觉不可访问性、通用未知、任务可行性及安全等五类场景下的选择性不合规能力。该基准包含 3,100 个实例,通过单句与复合查询对比测试发现,现有模型常无法恰当拒绝或保持沉默,且在需要选择性不合规的复合查询中表现更为显著。为此,研究者利用包含选择性不合规示例及完全可回答任务的 KoNA 数据进行微调,结果显示该方法在显著提升不合规准确性的同时,基本保持了模型在完全可回答任务上的性能,使其能够区分可回答组件与需不合规的组件并以恰当方式响应。

相关事件RELATED EVENTS
事件速览QUICK FACTS
3,100实例数量
5评估类别数
关键实体KEY ENTITIES
Hugging FaceHyounghun KimJihyoung JangKoNAMinji Kim

事件框架EVENT FRAME

研究成果

政府 · 科研机构跨 1 天

当前状态

KoNA 基准发布,揭示视觉语言模型在特定场景下存在选择性不合规缺陷。

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Hugging Face × Hyounghu…1Hugging Face × Jihyoung…1Hugging Face × Minji Kim1Hyounghun Kim × Jihyoun…1Hyounghun Kim × Minji K…1Jihyoung Jang × Minji K…1

整合时间线UNIFIED TIMELINE

  1. 2026-09-07

    KoNA 基准发布

    研究人员发布 KoNA 基准,评估视觉语言模型在错误前提、视觉不可访问性、通用未知、任务可行性及安全等五类场景下的选择性不合规能力。该基准包含 3,100 个实例,通过单句与复合查询对比测试发现现有模型常无法恰当拒绝或保持沉默。

    2 条报道

信号强度SIGNALS

关键词热度
  • KoNA1
  • Hugging Face1
  • Minji Kim1
  • Jihyoung Jang1
  • Hyounghun Kim1

全部报道(2)SOURCES

H Hugging Face Papers en 2026-09-07 08:00

Paper page - Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models

Minji Kim 等人在论文《Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models》中提出 KoNA 基准,用于评估视觉语言模型在假前提、视觉不可访问性、普遍未知、任务不可行及不安全等五类场景下的选择性不合规能力。该基准包含 3,100 个实例,通过单问与复合问对进行对比测试。现有研究表明,模型往往无法正确拒绝或保持沉默,且在需要选择性不合规的复合问中表现更差。作者提出使用 KoNA 示例配合完全可回答数据集对视觉语言模型进行微调,该方法在显著提升不合规准确性的同时,基本保持了完全可回答查询及通用基准的性能。

A arXiv cs.AI en 2026-09-07 12:00

Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models

研究人员发布 KoNA 基准,用于评估视觉语言模型在五个类别(错误前提、视觉不可访问性、通用未知、任务可行性、安全)中的选择性不合规能力。该基准通过配对单句和复合查询测试查询级与组件级不合规能力,发现现有模型常无法恰当拒绝或保持沉默,且此类失败在选择性不合规场景下更为显著。为此,研究者利用包含选择性不合规示例及完全可回答任务的 KoNA 数据进行微调,结果显示微调后的模型在不合规准确性上取得显著提升,同时基本保持了在完全可回答任务上的表现,能够区分可回答组件与需不合规的组件并以恰当方式响应。