智迹闻AuraTracer
EN

EVENT DOSSIER

“何时内部探针会超越对答案的解读?语言模型中测量误差以及隐藏在行为背后的知识”

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

一项针对 0.6B 参数语言模型的研究发现,其在验证 1,200 个逻辑结论时,行为表现无法区分真伪(准确率仅 50%),但线性探针能准确读取隐藏状态中的正确判决(AUC 0.96)。研究指出,导致判决丢失的主导因素是单个标量:模型输出 logits 中沿对齐方向的判决信息完整(AUC 0.89),却被一个偏移 +4.6 个标准差的饱和决策阈值擦除。该诊断具有普适性,在 90 种语义标签配置及跨模型实验中,行为准确率随阈值偏移呈单函数关系崩溃(Spearman -0.93),而边际排名受影响较小。研究提出可操作方案:通过单一参数校正、校准边际解码或调整提示词,将阈值重新中心化,可将 0.6B 模型的行为准确率从 50% 提升至 81%,使 8B 模型恢复至 94%。

相关事件RELATED EVENTS

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

When Do Internal Probes Beat Reading the Answer? Miscalibrated Readouts and Behavior-Concealed Knowledge in Language Models

一项针对 0.6B 语言模型的研究发现,其在验证 1,200 个逻辑结论时虽行为上无法区分真伪(准确率 50%),但线性探针可准确读取隐藏状态中的正确判决(AUC 0.96)。研究指出,导致判决丢失的主导因素是单个标量:模型输出 logits 中沿对齐方向的判决信息完整(AUC 0.89),却被一个偏移 +4.6 个标准差的饱和决策阈值擦除。该诊断具有普适性:在 90 种语义标签配置及跨模型实验中,行为准确率随阈值偏移呈单函数关系崩溃(Spearman -0.93),而边际排名受影响较小。研究提出可操作方案:通过单一参数校正、校准边际解码或调整提示词,将阈值重新中心化,可将 0.6B 模型的行为准确率从 50% 提升至 81%,使 8B 模型恢复至 94%。