TIER: Threat Implicitness Benchmark for Evaluating LLM Safety Behaviors
研究人员推出 TIER(Threat Implicitness Benchmark),用于评估大语言模型在从明确有害请求到复杂越狱攻击等不同威胁隐晦度下的安全行为。该基准涵盖四个风险领域和四个威胁等级,采用六标签行为量表及两个独立大语言模型进行响应评估。针对六个开源大模型的实验表明,安全行为随威胁等级逐渐演变而非直接切换;上下文提示产生最多样化的行为,而越狱攻击暴露最大的鲁棒性差距。此外,相似的攻击成功率可能对应截然不同的响应分布,凸显了开展基于行为的大语言模型安全评估的必要性。