TokenDial: Continuous Attribute Control for Text-to-Video Generation in Visual Dial Space
arXiv:2603.27520v2 发布 TokenDial,提出在视频扩散 Transformer 的视觉补丁通道维度构建 Visual Dial Space V+,通过广播加法方向控制生成视频的外观或运动属性。该框架冻结预训练视频生成器,仅优化加法方向,利用编辑视频沿目标属性移动且其余内容稳定的效果进行监督,无需配对编辑视频。学习到的方向成为可复用的视觉旋钮,支持连续外观与运动控制、显式时空定位及跨提示词、分辨率和视频长度的复用。实验与人工评估显示,TokenDial 在滑块可控性和内容保持方面优于现有视频编辑和滑块方法。