Molecular D\'ej\`a Vu: Digit-Level Retrieval of Published Values in Frontier Language Models
研究人员审计了 22 个前沿模型在 12 个回归基准上的verbatim检索情况,发现该现象广泛存在但具有特定性:在五个数据集上超过 50% 的大语言模型(LLMs)显示verbatim检索,而在其余数据集中仅出现在孤立单元格。实验表明推理水平改变检索行为,相同分子和提示下,高推理层级比最低层级多被标记 89% 的检索次数。此外,测试中断检索后发现,最强模型在部分情况下仍识别变换后的 SMILES 字符串与原始标签的组合;抑制检索使不同模型的预测误差相对趋同,而verbatim检索的使用差异则使其分散。这表明 LLM 的一般预测能力不仅取决于记忆值的数量。