摘要由 AI 生成
Meta 于 2026 年 9 月 2 日推出 Muse Voice Transcribe,由超级智能实验室开发。该模型以每小时 0.18 美元的定价提供实时语音转写、端点检测及 20 多名说话人分词功能。它支持超过一小时的长音频处理、无缝多语言代码切换,并在 70 种语言上训练(其中 25 种经广泛验证)。Muse 将说话人归因直接嵌入自回归多模态架构,在音频到达 80 毫秒片段时进行自适应延迟处理,无需独立后处理管道即可实现高容量实时分写。
关键实体KEY ENTITIES
Amazon TranscribeMetaMuse Voice TranscribeSpeechmaticsSuperintelligence Labs
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Meta1
- Muse Voice Transcribe1
- Superintelligence Labs1
- Speechmatics1
- Amazon Transcribe1
全部报道(1)SOURCES
↗
Meta 推出 Muse Voice Transcribe,以每小时 0.18 美元的价格提供实时语音转写、端点检测和 20 多名说话人分词功能。该模型由 Meta 超级智能实验室开发,支持长音频(超过一小时)、无缝多语言代码切换、语言与关键词偏置,以及无需独立后处理管道即可进行说话人分词。模型在 70 种语言上训练,其中 25 种语言经过广泛验证。尽管 20 多名说话人数量较高,但 Meta 的核心主张在于将高容量实时分词与低延迟转写、端点检测、多语言代码切换及激进 API 定价整合在同一模型中,这对企业开发者构建会议系统、通话分析、实时助手或环境 AI 可能更为重要。分词正逐渐成为语音栈的核心组成部分,而 Muse 将说话人归因直接嵌入到自回归多模态架构中,并在音频到达 80 毫秒片段时进行自适应延迟处理…