智迹闻AuraTracer
EN

EVENT DOSSIER

潜在事实核查:通过激活工程检测虚假信息

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

研究人员提出一种无需微调骨干模型的外部虚假信息检测框架。该方法利用语言模型表示空间的几何特性,通过对比真实与虚假陈述的激活值,依据对比激活加法原理在残差流中识别虚假信息方向。推理时,将未见声明的最后 token 激活投影至该方向并输入多层感知机进行分类。实验涵盖 Gemma、Llama 和 Qwen 家族共 11 个模型(参数量从 2.7 亿至 12 亿),在 AVeriTeC、LIAR 和 FACTors 三个基准测试中运行。结果显示,虚假信息方向可跨模型规模和架构恢复,在 LIAR 和 FACTors 上的最后 token 投影表现匹配或超越零样本及少样本提示基线,小模型增益最为显著。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
LaFaCtMalta-Lab

事件框架EVENT FRAME

产品发布

Malta-Lab LaFaCt 提出基于激活工程的虚假信息检测框架

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
LaFaCt × Malta-Lab1

信号强度SIGNALS

关键词热度
  • Malta-Lab1
  • LaFaCt1

全部报道(1)SOURCES

A arXiv cs.LG en 2026-09-07 12:00

Latent Fact-Checking: Detecting Misinformation through Activation Engineering

研究人员提出一种基于激活工程的虚假信息检测框架,利用语言模型表示空间的几何特性。该方法通过对比真实与虚假陈述的激活值,依据对比激活加法(CAA)原理在残差流中 eliciting 虚假信息方向;推理时将未见声明的最后 token 激活投影至该方向并输入多层感知机(MLP)进行分类。此过程无需微调骨干模型、无需外部证据检索,仅需用于估计方向的对比对即可运行。研究在 Gemma、Llama 和 Qwen 家族的 11 个模型(参数量从 2.7 亿至 12 亿)上进行了评估,涵盖 AVeriTeC、LIAR 和 FACTors 三个基准测试。结果显示,虚假信息方向可跨模型规模和架构恢复,在 LIAR 和 FACTors 上的最后 token 投影表现匹配或超越零样本及少样本提示基线,小模型增益最大;AVeriTeC…