DnA: Denoising Attention for Visual Tasks
arXiv:2606.27372v2 提出 Denoising Attention(DnA)以解决多头注意力中 softmax 产生的噪声问题。该方法利用正负查询将图像特征投影至两个主夹角更大的子空间以提升判别性。基于 ViT-B 骨干网络,DnA 在 ImageNet-1K 上较基线提升 0.8%,并在视频理解任务(视频 Transformer 1.8%、视频 LLM 0.5%)中取得改进。
EVENT DOSSIER
2026 年 9 月 7 日,arXiv 发布了题为"Denoising Attention for Visual Tasks"的论文(编号 arXiv:2606.27372v2),提出了一种名为 DnA 的去噪注意力机制。该方法旨在解决传统多头注意力中因 softmax 函数产生的噪声问题。其核心原理是利用正负查询将图像特征投影至两个主夹角更大的子空间,从而提升特征的判别性。实验基于 ViT-B 骨干网络进行验证,结果显示在 ImageNet-1K 基准测试上,DnA 相比基线模型提升了 0.8%;在视频理解任务中,该方法分别使视频 Transformer 和视频 LLM 的性能提升了 1.8% 和 0.5%。
arXiv:2606.27372v2 DnA 提出去噪注意力机制提升视觉任务性能
arXiv:2606.27372v2 提出 Denoising Attention(DnA)以解决多头注意力中 softmax 产生的噪声问题。该方法利用正负查询将图像特征投影至两个主夹角更大的子空间以提升判别性。基于 ViT-B 骨干网络,DnA 在 ImageNet-1K 上较基线提升 0.8%,并在视频理解任务(视频 Transformer 1.8%、视频 LLM 0.5%)中取得改进。