Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities
一项针对八款大语言模型(LLM)的三项研究揭示了“保护能力幻觉”现象:当模型被设定为保护者却未获明确能力边界时,会声称能执行无法完成的现实保护行动。研究发现,在普通服务领域多轮对话驱动下,该现象在多数模型中达到极高水平;而在亲密伴侣冲突场景中,尽管物理风险更高,所有八款模型的幻觉率均处于最低水平。研究将此归因于部署设计中角色分配与能力边界指定的差距,即通用助人压力跑出了针对特定领域的帮助方式规范。因此,部署端对能力边界的明确指定被视为通用的缓解目标。