智迹闻AuraTracer
EN

EVENT DOSSIER

Motion-Omni:端到端联合语音和全身动作技术,用于口语对话

模型于 2026-09-07 在 arXiv 及 Hugging Face Papers 同步发布,核心指标已公布。

2026-09-07 12:00 大模型 🔥 47.2 事件热度
2家信源
1天持续发酵
47.2事件热度
8个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv 及 Hugging Face Papers 同步发布 Motion-Omni 模型。该研究提出一种端到端联合生成语音与全身动作(含面部、手部及上下半身)的框架,旨在解决传统级联方案中多模态无法协同优化的问题。模型采用 Qwen2.5-7B-Instruct 作为骨干网络,直接从语音隐藏状态输出动作特征,并通过冻结语音路径强制 LLM、语音生成器与动作生成器进行联合训练。其监督数据源自包含 422,856 对高质量配对(累计 1,402 小时)的可扩展管道。在公开评估中,Motion-Omni-Q7 实例在参考无关动作指标上与教师级联系统差距小于 2%,推理速度提升 5.4 倍(RTF=0.78),在节拍相关性和多样性上超越所有非教师级联系统,词错误率低至 2.62%。…

相关事件RELATED EVENTS
事件速览QUICK FACTS
Qwen2.5-7B-Instruct骨干网络
每秒 0.78 个 token(RTF)推理速度
2.62%WER
距离教师级联仅差 2%误差差距
关键实体KEY ENTITIES
Chengqian MaHaoyu ZhangHugging FaceMotion-OmniQwen2.5-7B-InstructSwDA-500Wei TaoYiwen Guo

事件框架EVENT FRAME

产品发布

政府 · 科研机构跨 1 天

当前状态

模型于 2026-09-07 在 arXiv 及 Hugging Face Papers 同步发布,核心指标已公布。

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Chengqian Ma × Haoyu Zh…1Chengqian Ma × Hugging …1Chengqian Ma × Wei Tao1Chengqian Ma × Yiwen Guo1Haoyu Zhang × Hugging F…1Haoyu Zhang × Wei Tao1

整合时间线UNIFIED TIMELINE

  1. 2026-09-07

    Motion-Omni 模型同步发布

    arXiv cs.CV 及 Hugging Face Papers 同步发布 Motion-Omni,提出端到端联合生成语音与全身动作框架。

    2 条报道

信号强度SIGNALS

关键词热度
  • Hugging Face1
  • Chengqian Ma1
  • Wei Tao1
  • Haoyu Zhang1
  • Yiwen Guo1
  • Motion-Omni1
  • SwDA-5001
  • Qwen2.5-7B-Instruct1

全部报道(2)SOURCES

H Hugging Face Papers en 2026-09-07 08:00

Paper page - Motion-Omni:用于口语对话的端到端联合语音与全身动作技术

Motion-Omni 提出了一种端到端模型,原生生成对话语音及面部、手部、上半身和下半身动作。该模型在参考无关运动指标上距离教师级联仅差 2%,推理速度为每秒 0.78 个 token(RTF),WER 为 2.62%。其核心机制是联合优化 LLM、语音生成器和运动生成器,以解决传统级联方案中无法进行联合优化的问题。监督数据来自包含 422,856 对高质量配对数据的模型无关管道,并发布了首个公开评估协议。

A arXiv cs.CV en 2026-09-07 12:00

Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

arXiv:2609.04250v1 发布 Motion-Omni,提出一种端到端联合生成语音与全身动作的框架。该框架利用 Qwen2.5-7B-Instruct 骨干网络,直接从产生语音的隐藏状态中输出面部表情及手、上半身和下半身的动作,并通过冻结语音路径强制 LLM、语音生成器和动作生成器协同训练以恢复对齐。监督数据来自包含 422,856 对高质量配对(1,402 小时)的可扩展管道,并发布了首个针对随机开放式全身口语对话的公开评估协议。Motion-Omni-Q7 实例在参考无关动作指标上与教师级联差距小于 2%,响应速度提升 5.4 倍(RTF=0.78),在节拍相关性和多样性上超越所有非教师级联系统,且词错误率低至 2.62%。