摘要由 AI 生成
2026 年 9 月 7 日,arXiv 及 Hugging Face Papers 同步发布 Motion-Omni 模型。该研究提出一种端到端联合生成语音与全身动作(含面部、手部及上下半身)的框架,旨在解决传统级联方案中多模态无法协同优化的问题。模型采用 Qwen2.5-7B-Instruct 作为骨干网络,直接从语音隐藏状态输出动作特征,并通过冻结语音路径强制 LLM、语音生成器与动作生成器进行联合训练。其监督数据源自包含 422,856 对高质量配对(累计 1,402 小时)的可扩展管道。在公开评估中,Motion-Omni-Q7 实例在参考无关动作指标上与教师级联系统差距小于 2%,推理速度提升 5.4 倍(RTF=0.78),在节拍相关性和多样性上超越所有非教师级联系统,词错误率低至 2.62%。…
关键实体KEY ENTITIES
Chengqian MaHaoyu ZhangHugging FaceMotion-OmniQwen2.5-7B-InstructSwDA-500Wei TaoYiwen Guo
事件框架EVENT FRAME
当前状态
模型于 2026-09-07 在 arXiv 及 Hugging Face Papers 同步发布,核心指标已公布。
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
整合时间线UNIFIED TIMELINE
-
2026-09-07
Motion-Omni 模型同步发布
arXiv cs.CV 及 Hugging Face Papers 同步发布 Motion-Omni,提出端到端联合生成语音与全身动作框架。
2 条报道
信号强度SIGNALS
关键词热度
- Hugging Face1
- Chengqian Ma1
- Wei Tao1
- Haoyu Zhang1
- Yiwen Guo1
- Motion-Omni1
- SwDA-5001
- Qwen2.5-7B-Instruct1
全部报道(2)SOURCES
↗
Motion-Omni 提出了一种端到端模型,原生生成对话语音及面部、手部、上半身和下半身动作。该模型在参考无关运动指标上距离教师级联仅差 2%,推理速度为每秒 0.78 个 token(RTF),WER 为 2.62%。其核心机制是联合优化 LLM、语音生成器和运动生成器,以解决传统级联方案中无法进行联合优化的问题。监督数据来自包含 422,856 对高质量配对数据的模型无关管道,并发布了首个公开评估协议。
↗
arXiv:2609.04250v1 发布 Motion-Omni,提出一种端到端联合生成语音与全身动作的框架。该框架利用 Qwen2.5-7B-Instruct 骨干网络,直接从产生语音的隐藏状态中输出面部表情及手、上半身和下半身的动作,并通过冻结语音路径强制 LLM、语音生成器和动作生成器协同训练以恢复对齐。监督数据来自包含 422,856 对高质量配对(1,402 小时)的可扩展管道,并发布了首个针对随机开放式全身口语对话的公开评估协议。Motion-Omni-Q7 实例在参考无关动作指标上与教师级联差距小于 2%,响应速度提升 5.4 倍(RTF=0.78),在节拍相关性和多样性上超越所有非教师级联系统,且词错误率低至 2.62%。