SNAP: Speaker Nulling for Artifact Projection in Speech Deepfake Detection
研究团队提出 SNAP 框架,通过估计说话人子空间并应用正交投影来抑制说话人依赖成分,旨在解决基于自监督学习的语音编码器在检测深度伪造时因“说话人纠缠”现象导致的泛化能力不足问题。该方法将说话人信息从特征中剔除,使检测器专注于合成伪影相关的线索,从而在未见过的说话人上实现最先进的检测性能。
EVENT DOSSIER
针对基于自监督学习的语音编码器在检测深度伪造时因“说话人纠缠”现象导致的泛化能力不足问题,研究团队提出了 SNAP(Speaker Nulling for Artifact Projection)框架。该框架通过估计说话人子空间并应用正交投影技术,有效抑制了特征中的说话人依赖成分,使检测器能够专注于合成伪影相关的线索。实验表明,该方法在未见过的说话人上实现了最先进的检测性能,显著提升了语音深度伪造检测的泛化能力。
研究团队提出 SNAP 框架,通过估计说话人子空间并应用正交投影来抑制说话人依赖成分,旨在解决基于自监督学习的语音编码器在检测深度伪造时因“说话人纠缠”现象导致的泛化能力不足问题。该方法将说话人信息从特征中剔除,使检测器专注于合成伪影相关的线索,从而在未见过的说话人上实现最先进的检测性能。