SCAPES: Semantically Conditioned Autoregressive Prior for Environmental Sounds
arXiv:2609.04634v1 发布 SCAPES,一种用于环境声音生成的语义条件自回归先验模型。该轻量级模型基于神经音频编码器的连续潜在流形运行,通过分段策略结合连续归一化流与流匹配技术,在有限未筛选数据集上仅需单张消费级显卡即可训练。实验表明,3600 万参数实例收敛于约两倍源音频时长后,能生成高保真、长期稳定且语义一致的声音,并支持平滑语义插值。代码、预训练权重及交互式演示已公开。