智迹闻AuraTracer
EN

EVENT DOSSIER

MCPO:用于多模态思维链压缩的对比偏好优化方法

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv 发布 MCPO(Modality-Contrastive Preference Optimization)论文,提出一种仅需少于 900 个训练样本的高效多模态思维链压缩方法。该方法采用两阶段优化:在压缩阶段引入基于归一化跨模态互信息(NCMI)的剪枝算法,通过对比有图与无图上下文推理差异自动剔除视觉无关步骤;在对齐阶段先进行监督微调,再采用非对称多模态长度控制偏好损失优化,利用非线性几率比公式强化优选轨迹的长度约束并维持模态一致性。实验表明,该方法可将 Qwen3-VL-Thinking 等主流基模型的思维链长度减少最多 69.5%,实现最高 3.34 倍端到端推理加速,同时保持原始准确率。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Qwen3-VL-Thinking

信号强度SIGNALS

关键词热度
  • Qwen3-VL-Thinking1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

MCPO: Modality-Contrastive Preference Optimization for Multimodal Chain-of-Thought Compression

提出 Modality-Contrastive Preference Optimization (MCPO),一种仅需少于 900 个训练样本的高效两阶段多模态思维链压缩方法。该方法在压缩阶段引入基于归一化跨模态互信息 (NCMI) 的剪枝算法,通过对比有图与无图上下文推理差异自动剔除视觉无关步骤;在对齐阶段先进行监督微调,再采用非对称多模态长度控制偏好损失优化,利用非线性几率比公式强化优选轨迹的长度约束并维持模态一致性。实验表明,该方法可将 Qwen3-VL-Thinking 等主流基模型的思维链长度减少最多 69.5%,实现最高 3.34 倍端到端推理加速,同时保持原始准确率。