IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks
印度研究团队推出 IndicSafeEval 框架,针对印地语、孟加拉语、马拉地语和旁遮普语四种印度语言开展安全鲁棒性评估,生成涵盖十类关键内容与安全策略的 7,200 个对抗提示。该框架对开源大语言模型进行黑盒测试,发现模型在不同语言和提示风格下的安全表现存在显著差异,且不同风险类别的脆弱程度不一。现有以英语为中心的安全评估方法存在局限,亟需建立多语言及说服感知的基准框架以更准确评估真实世界中的大语言模型安全性。