智迹闻AuraTracer
EN

EVENT DOSSIER

X-VC:编解码器空间中的零样本流式语音转换

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv cs.AI 发布 X-VC 系统,该系统在预训练神经编解码器的潜空间中实现了零样本流式语音转换。系统采用双条件声学转换器,联合建模源编解码潜帧与目标参考语音的帧级声学条件,并通过自适应归一化注入说话人信息。为降低训练与推理不匹配问题,研究团队使用生成配对数据及结合标准、重建和反向模式的角色分配策略进行训练;流式推理则采用与编解码器分段训练范式对齐的分块推理及重叠平滑方案。在 Seed-TTS-Eval 实验评估中,X-VC 在英语和中文环境下均取得了最佳的流式词错误率(WER),在同语言与跨语言设置下表现出高说话人相似度,且离线实时因子显著低于对比基线系统。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Seed-TTS-EvalX-VC

事件框架EVENT FRAME

产品发布

arXiv:2604.12456v3 X-VC 提出零样本流式语音转换系统

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Seed-TTS-Eval × X-VC1

信号强度SIGNALS

关键词热度
  • X-VC1
  • Seed-TTS-Eval1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

X-VC: Zero-shot Streaming Voice Conversion in Codec Space

X-VC 系统实现了在预训练神经编解码器潜空间中进行的一步式零样本流式语音转换。该系统采用双条件声学转换器,联合建模源编解码潜帧与源自目标参考语音的帧级声学条件,并通过自适应归一化注入目标说话人信息;为降低训练与推理不匹配,使用生成配对数据及结合标准、重建和反向模式的角色分配策略进行训练;流式推理则采用与编解码器分段训练范式对齐的分块推理及重叠平滑方案。在 Seed-TTS-Eval 实验上,X-VC 在英语和中文中均取得最佳流式 WER,在同语言与跨语言设置下表现出强说话人相似度,且离线实时因子显著低于对比基线。