智迹闻AuraTracer
EN

EVENT DOSSIER

TokenDial:视觉调谐空间中文本转视频生成的连续属性控制技术

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv 发布 TokenDial 框架,旨在解决文本生成视频中的连续属性控制问题。该方法在视觉扩散 Transformer 的视觉补丁通道维度构建 Visual Dial Space V+,通过广播加法方向进行控制。TokenDial 冻结预训练视频生成器,仅优化加法方向,利用编辑视频沿目标属性移动且其余内容稳定的效果进行监督,无需配对编辑视频。学习到的方向成为可复用的视觉旋钮,支持连续外观与运动控制、显式时空定位及跨提示词、分辨率和视频长度的复用。实验与人工评估显示,TokenDial 在滑块可控性和内容保持方面优于现有视频编辑和滑块方法。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
TokenDial

事件框架EVENT FRAME

产品发布

arXiv:2603.27520v2 TokenDial 提出视觉拨号空间连续属性控制框架

信号强度SIGNALS

关键词热度
  • TokenDial1

全部报道(1)SOURCES

A arXiv cs.CV en 2026-09-07 12:00

TokenDial: Continuous Attribute Control for Text-to-Video Generation in Visual Dial Space

arXiv:2603.27520v2 发布 TokenDial,提出在视频扩散 Transformer 的视觉补丁通道维度构建 Visual Dial Space V+,通过广播加法方向控制生成视频的外观或运动属性。该框架冻结预训练视频生成器,仅优化加法方向,利用编辑视频沿目标属性移动且其余内容稳定的效果进行监督,无需配对编辑视频。学习到的方向成为可复用的视觉旋钮,支持连续外观与运动控制、显式时空定位及跨提示词、分辨率和视频长度的复用。实验与人工评估显示,TokenDial 在滑块可控性和内容保持方面优于现有视频编辑和滑块方法。