针对多模态大语言模型(MLLMs)在复杂结构化需求场景下表现不佳的问题,研究者提出了一种名为 First Things First Reinforcement Learning (FTF-rl) 的方法。该方法利用强化学习显式优化模型对多重优先级用户需求的推理能力,重点处理必须满足项的唯一解、多解排序及无解时 abstain(不生成响应)三类场景。研究团队在涵盖电商、预订及网约车等真实服务领域的 3,649 个精心构建问题上进行了评估,发现现有 SOTA MLLMs 在所有场景中均存在灾难性失败。实验结果表明,FTF-rl 相比强基线方法显著提升了任务成功率,并在 LogicVista、MathVision 和 InfoQA 等通用逻辑与数学推理任务中展现出良好的通用有效性。
针对多模态大语言模型(MLLMs)在复杂结构化需求场景下表现不佳的问题,研究者提出了一种名为 First Things First Reinforcement Learning (FTF-rl) 的方法,旨在优化模型对多重优先级用户需求的推理能力。该方法通过强化学习显式处理三类需求场景:必须满足项唯一确定解、必须满足项有多个解需结合次要项排序,以及必须满足项无解时 abstain(不生成响应)。研究团队在包含电商、预订及地图/网约车等真实服务场景的 3,649 个精心构建问题上对现有 SOTA MLLMs 进行了评估,发现其在所有场景中均存在灾难性失败。实验结果表明,FTF-rl 相比强基线方法显著提升了任务成功率,并在 LogicVista、MathVision 和 InfoQA 等通用逻辑与数学推理任务上…