MCPO: Modality-Contrastive Preference Optimization for Multimodal Chain-of-Thought Compression
提出 Modality-Contrastive Preference Optimization (MCPO),一种仅需少于 900 个训练样本的高效两阶段多模态思维链压缩方法。该方法在压缩阶段引入基于归一化跨模态互信息 (NCMI) 的剪枝算法,通过对比有图与无图上下文推理差异自动剔除视觉无关步骤;在对齐阶段先进行监督微调,再采用非对称多模态长度控制偏好损失优化,利用非线性几率比公式强化优选轨迹的长度约束并维持模态一致性。实验表明,该方法可将 Qwen3-VL-Thinking 等主流基模型的思维链长度减少最多 69.5%,实现最高 3.34 倍端到端推理加速,同时保持原始准确率。