Latent-Aligned Reasoning for Multimodal Recommendation
提出名为 LARK 的潜对齐推理框架,旨在解决多模态视觉语言模型在推荐任务中因多步推理导致视听信号衰减(跨模态稀释)的问题。该框架包含两个阶段:第一阶段将可学习隐式令牌与多步思维链推理交织,并与冻结的视觉编码器对齐以保留感知细节;第二阶段通过桥接全连接层投影并训练,利用物品间对比学习防止语义消退,同时将中间特征与第一阶段的思维链隐藏状态对齐。在三个公开基准测试集和一个工业数据集上的实验表明,LARK 在多种推荐架构中达到最先进水平,消融实验证实了各组件的独立贡献。