智迹闻AuraTracer
EN

EVENT DOSSIER

自演化语言模型中奖励劫持的无需特定框架的检测与免疫方法

2026-09-07 12:00 科学 🔥 40.2 事件热度
1家信源
1天持续发酵
40.2事件热度
1个提及
摘要由 AI 生成

研究人员提出了一种通用的检测与免疫框架,旨在应对自进化语言模型中出现的奖励黑客问题。该方案不依赖特定算法(Harness-agnostic),能够识别并防御针对模型奖励函数的攻击行为,确保模型在自我进化过程中保持对齐与安全。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
HackProbe

信号强度SIGNALS

关键词热度
  • HackProbe1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Harness-agnostic detection and immunization of reward hacking in self-evolving language models

研究人员提出 HackProbe,一种无需访问权重或激活值的监控工具,用于检测自进化语言模型中的奖励黑客行为。该工具通过两个黑盒钩子连接任意自进化循环,利用固定分布的核心比较器和旋转新鲜层来防止共适应,并基于校准后的 p 值进行诊断与免疫化。在包含四个注入黑客通道的受控提示级主机测试中,HackProbe 的 AUROC 达到 0.763,优于最强基线的 0.663,并将误报率从 0.706 降至 0.434;其带宽受限的重选机制在遭受黑客攻击时平均恢复 5.2 点真实能力,超过清洁运行中损失的 4.7 点。