Cross-Task Generalization Between Understanding and Generation in Unified Vision-Language Models: A Controlled Study
一项针对统一视觉语言模型(VLM)中理解与生成跨任务泛化的受控研究发布。该研究构建了包含配对问答、图像描述及文生图任务的 SmartWatch 和修改版 CelebA 两个基准,评估了基于 SigLIP 和 VQ-VAE 的多种 LLM 架构。实验表明,混合训练虽能提升两项任务表现,但效果高度依赖视觉输入与输出空间的关联度;空间对齐良好的模型泛化更强,而可逆仿射扭曲会削弱此效应并引发冲突。此外,增加单一任务数据初期有益但过度失衡会导致互补任务退化,生成监督有助于恢复理解中欠代表的概念。分析显示,跨空间泛化主要源于基础语言模型学习关系而非视觉适配器特征,LLaVA 实测进一步证实了混合训练对视觉理解的益处。