摘要由 AI 生成
arXiv 于 2026 年 9 月 7 日发布 GEPARD,这是一款基于大语言模型(LLM)骨干的流式文本转语音模型,专为实时对话设计。该模型采用单一解码器架构,通过联合训练文本与音频嵌入,并利用 FSQ 神经编码器逐块生成波形。其核心设计理念是不修改标准 LLM 引擎(如 vLLM)的计算内核。在单流推理中,GEPARD 的实时因子约为 0.067,速度达到实时的 15 倍;在单个服务器级 GPU 上支持 256 个并发流时,整体加速比可达约 204 倍。论文还详细阐述了针对自回归语音解码器“短注册”故障模式的诊断与缓解方法,以及通过直接偏好优化(DPO)将两路分类器自由引导蒸馏为单路权重的技术细节。
关键实体KEY ENTITIES
GEPARDvLLM
事件框架EVENT FRAME
产品发布
GEPARD
GEPARD
生成式韵律感知自回归 TTS 模型发布
报道态势 · 每日报道量LANGUAGE SPLIT
信号强度SIGNALS
全部报道(1)SOURCES
↗
GEPARD 是一款基于 LLM 骨干的流式文本转语音模型,旨在实现实时对话。该模型采用单一解码器架构,将文本与音频嵌入联合训练,并通过 FSQ 神经编码器逐块生成波形,核心设计原则是不修改标准 LLM 引擎(如 vLLM)的计算内核。在单流推理中,其实时因子约为 0.067,速度约为实时的 15 倍;在单个服务器级 GPU 上支持 256 个并发流时,整体加速比可达约 204 倍。论文详细阐述了 vLLM 原生服务的系统级解决方案、针对自回归语音解码器“短注册”故障模式的诊断与缓解方法,以及通过直接偏好优化(DPO)将两路分类器自由引导蒸馏为单路权重的技术细节。