摘要由 AI 生成
2026 年 9 月 7 日,arXiv cs.AI 发布 X-VC 系统,该系统在预训练神经编解码器的潜空间中实现了零样本流式语音转换。系统采用双条件声学转换器,联合建模源编解码潜帧与目标参考语音的帧级声学条件,并通过自适应归一化注入说话人信息。为降低训练与推理不匹配问题,研究团队使用生成配对数据及结合标准、重建和反向模式的角色分配策略进行训练;流式推理则采用与编解码器分段训练范式对齐的分块推理及重叠平滑方案。在 Seed-TTS-Eval 实验评估中,X-VC 在英语和中文环境下均取得了最佳的流式词错误率(WER),在同语言与跨语言设置下表现出高说话人相似度,且离线实时因子显著低于对比基线系统。
关键实体KEY ENTITIES
Seed-TTS-EvalX-VC
事件框架EVENT FRAME
产品发布
arXiv:2604.12456v3
X-VC
提出零样本流式语音转换系统
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
全部报道(1)SOURCES
↗
X-VC 系统实现了在预训练神经编解码器潜空间中进行的一步式零样本流式语音转换。该系统采用双条件声学转换器,联合建模源编解码潜帧与源自目标参考语音的帧级声学条件,并通过自适应归一化注入目标说话人信息;为降低训练与推理不匹配,使用生成配对数据及结合标准、重建和反向模式的角色分配策略进行训练;流式推理则采用与编解码器分段训练范式对齐的分块推理及重叠平滑方案。在 Seed-TTS-Eval 实验上,X-VC 在英语和中文中均取得最佳流式 WER,在同语言与跨语言设置下表现出强说话人相似度,且离线实时因子显著低于对比基线。