When Do Internal Probes Beat Reading the Answer? Miscalibrated Readouts and Behavior-Concealed Knowledge in Language Models
一项针对 0.6B 语言模型的研究发现,其在验证 1,200 个逻辑结论时虽行为上无法区分真伪(准确率 50%),但线性探针可准确读取隐藏状态中的正确判决(AUC 0.96)。研究指出,导致判决丢失的主导因素是单个标量:模型输出 logits 中沿对齐方向的判决信息完整(AUC 0.89),却被一个偏移 +4.6 个标准差的饱和决策阈值擦除。该诊断具有普适性:在 90 种语义标签配置及跨模型实验中,行为准确率随阈值偏移呈单函数关系崩溃(Spearman -0.93),而边际排名受影响较小。研究提出可操作方案:通过单一参数校正、校准边际解码或调整提示词,将阈值重新中心化,可将 0.6B 模型的行为准确率从 50% 提升至 81%,使 8B 模型恢复至 94%。