智迹闻AuraTracer
EN

EVENT DOSSIER

Molecular D’ej\a Vu:在前沿语言模型中对已发布数值进行数字化检索

2026-09-07 12:00 科学 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
0个提及
摘要由 AI 生成

一项针对 22 个前沿语言模型的审计研究发现,这些模型在回归基准任务中广泛存在数字级记忆复用(verbatim retrieval)现象。具体而言,在五个特定数据集上,超过 50% 的模型表现出此类行为;而在其余数据集中,该现象仅以孤立单元格的形式出现。实验进一步表明,推理层级的变化会显著改变检索行为:在相同分子和提示条件下,高推理层级的模型比低层级模型多被标记 89% 的检索次数。此外,测试显示最强模型在部分情况下仍能识别变换后的 SMILES 字符串与原始标签的组合。当抑制检索后,不同模型的预测误差趋于一致,但数字级复用行为的使用差异导致结果分散。这些发现表明,大语言模型的一般预测能力不仅取决于其记忆值的数量。

相关事件RELATED EVENTS

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Molecular D\'ej\`a Vu: Digit-Level Retrieval of Published Values in Frontier Language Models

研究人员审计了 22 个前沿模型在 12 个回归基准上的verbatim检索情况,发现该现象广泛存在但具有特定性:在五个数据集上超过 50% 的大语言模型(LLMs)显示verbatim检索,而在其余数据集中仅出现在孤立单元格。实验表明推理水平改变检索行为,相同分子和提示下,高推理层级比最低层级多被标记 89% 的检索次数。此外,测试中断检索后发现,最强模型在部分情况下仍识别变换后的 SMILES 字符串与原始标签的组合;抑制检索使不同模型的预测误差相对趋同,而verbatim检索的使用差异则使其分散。这表明 LLM 的一般预测能力不仅取决于记忆值的数量。