智迹闻AuraTracer
EN

EVENT DOSSIER

Beyond Visual CoT:用于主动视频推理的内化视觉思维

2026-08-24 08:00 大模型 🔥 28.9 事件热度
1家信源
1天持续发酵
28.9事件热度
1个提及
摘要由 AI 生成

苹果公司机器学习研究团队于 2026 年 8 月 24 日发布名为"Beyond Visual CoT"的新研究成果。该研究提出了一种内部化视觉思维机制,旨在实现主动视频推理。与传统方法不同,该机制不依赖外部视觉提示,而是通过内化视觉思考过程来驱动模型对视频内容的主动分析与推理能力。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
Multimodal large language models

信号强度SIGNALS

关键词热度
  • Multimodal large language models1

全部报道(1)SOURCES

A Apple ML Research en 2026-08-24 08:00

Beyond Visual CoT:用于主动视频推理的内化视觉思维

多模态大语言模型在推理空间、时间及具身环境时采用视觉思维链(Visual CoT),虽提供直观的前瞻机制但引入显著推理开销,这对主动视频推理尤为不利。研究提出内部化视觉思维(IVT)框架,旨在让模型在训练期间学习视觉思考,而在推理阶段直接进行推理。该框架为一种后训练方法,联合优化文本预测与……