智迹闻AuraTracer
EN

EVENT DOSSIER

在 LJSpeech 上构建了一个从零开始的 TTS 管道(FastSpeech2 + HiFi-GAN)[P]

2026-09-07 14:51 科学 🔥 40.2 事件热度
1家信源
1天持续发酵
40.2事件热度
4个提及
摘要由 AI 生成

数据科学家 Ashwin3290 利用 LJSpeech-1.1 数据集,从零构建了包含强制对齐、FastSpeech2 声学模型及 HiFi-GAN 编码器的文本转语音(TTS)流水线。该系统通过 CTC 强制对齐中的静音标记插入自然停顿,并依据时长与能量门控进行过滤。在 Whisper base.en 评分下,开启 PostNet 的测试集词错误率(WER)为 8.8%,字符错误率(CER)为 5.1%;基于真实音频基准的 WER 为 4.9%,主要误差源于数字转录差异而非合成失败。HiFi-GAN 微调初期因初始化问题导致输出刺耳,后改用通用检查点权重修复,使损失稳定在 1.6-2.2 区间。相关代码已托管于 GitHub,模型权重与样本数据位于 Hugging Face。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
FastSpeech2HiFi-GANLJSpeechWhisper

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
FastSpeech2 × HiFi-GAN1FastSpeech2 × LJSpeech1FastSpeech2 × Whisper1HiFi-GAN × LJSpeech1HiFi-GAN × Whisper1LJSpeech × Whisper1

信号强度SIGNALS

关键词热度
  • LJSpeech1
  • FastSpeech21
  • HiFi-GAN1
  • Whisper1

全部报道(1)SOURCES

R r/MachineLearning en 2026-09-07 14:51

在 LJSpeech 上构建了一个从零开始的 TTS 管道(FastSpeech2 + HiFi-GAN)[P]

数据科学家 Ashwin3290 基于 LJSpeech-1.1 数据集从头构建了包含强制对齐、FastSpeech2 声学模型、独立 PostNet 及微调 HiFi-GAN 编码器的 TTS 流水线。该代码托管于 GitHub,权重与样本位于 Hugging Face。在 Whisper base.en 评分下,开启 PostNet 的测试集 WER 为 8.8%,CER 为 5.1%;真实音频基准 WER 为 4.9%,主要误差源于数字转录差异而非合成失败。系统通过 CTC 强制对齐中的静音标记插入自然停顿,并依据时长与能量门控进行过滤。HiFi-GAN 微调时因初始化判别器随机导致输出刺耳,后改用通用检查点权重修复,损失稳定在 1.6-2.2 区间。模型虽能处理未见单词,但对不熟悉音素序列(如"Hig…