《你真的没明白吗?关于间接和趣味性的中文在线评论的社会实用推理比较研究》
研究人员基于超过 20 万条公开中文社交媒体互动记录,构建了包含 4,735 个经人工验证的诊断项的基准,用于评估大语言模型(LLM)在特定对话中恢复间接和戏谑式社会意义的能力。该基准将目标评论与重构的前置语境及可能的误读配对,并在交叉写作设置中测试了八款 LLM 作为提问者和解答者的表现。结果显示,最强模型的留作者外准确率仅为 81.42%,所有模型平均准确率为 68.70%,而人类准确率达 90.8%。案例分析表明,模型常能识别广义的讽刺或戏谑,但往往误判其具体机制或互动行为。