CC-Mediation: Evaluating Large Language Models for Cross-Cultural Conflict Mediation
研究团队推出 CC-Mediation 基准,包含基于 DMIS 模型的 1661 条十轮对话数据。该基准旨在解决跨文化冲突调解中缺乏可衡量下游效果数据集及原则性评估指标的问题。研究提出了两个基于 DMIS 的评估指标:轨迹 AUC 用于衡量跨文化改善的持续性,有符号 Wasserstein-1 距离用于衡量立场转变的幅度和方向。实验发现,当前大语言模型在干预时机(何时介入)和调解策略(如何响应)两方面均存在局限:前者源于忽略对话内容的位序先验,后者源于深层网络激发崩溃而非知识缺失。