Autoregressive Guidance of Deep Spatially Selective Filters using Bayesian Tracking for Efficient Extraction of Moving Speakers
本文提出一种基于贝叶斯跟踪的自回归引导深度空间选择性滤波器方法,旨在动态场景下高效提取移动说话人。该方法利用帧级因果处理中的时间反馈,将增强后的语音信号纳入轻量化跟踪算法以改进跟踪性能。研究开发了基于社会力模型的合成数据生成框架以提升轨迹仿真真实性,实验结果表明自回归融合显著提高了贝叶斯跟踪器准确率,实现了无或仅微量增加计算开销的卓越增强效果,且经真实录音验证具有对未见声学条件的泛化能力。