MM-IFEval-Pro: A Multilingual and Attack-Resistant Benchmark for Instruction-Following in Vision-Language Models
arXiv:2609.04859v1 发布 MM-IFEval-Pro,这是一个覆盖中文和英文任务及多种指令劫持案例的多模态指令遵循基准。该基准包含 4 大类、24 个子类及 8 类共 52 个子类,每个样本平均包含 3.0 个约束以模拟复杂场景。研究团队构建了包含中文和对抗性指令的强化学习训练集,显著提升了模型在 MM-IFEval-Pro 上的表现,并有效迁移至其他主流多模态基准,展现出强大的跨任务和跨语言泛化能力。