智迹闻AuraTracer
EN

EVENT DOSSIER

IndicSafeEval:多语言说服性破解攻击下大型语言模型的安全性与鲁棒性

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
1个提及
摘要由 AI 生成

印度研究团队推出名为 IndicSafeEval 的安全评估框架,旨在解决现有以英语为中心的大语言模型安全评估局限性。该框架针对印地语、孟加拉语、马拉地语和旁遮普语四种印度语言开展测试,生成了涵盖十类关键内容与安全策略的 7,200 个对抗提示。研究团队利用该框架对开源大语言模型进行了黑盒测试,发现模型在不同语言和提示风格下的安全表现存在显著差异,且不同风险类别的脆弱程度不一。结果表明,亟需建立多语言及说服感知的基准框架,以更准确评估真实世界中的大语言模型安全性。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
IndicSafeEval

信号强度SIGNALS

关键词热度
  • IndicSafeEval1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

IndicSafeEval: Safety Robustness of Large Language Models under Multilingual Persuasive Jailbreak Attacks

印度研究团队推出 IndicSafeEval 框架,针对印地语、孟加拉语、马拉地语和旁遮普语四种印度语言开展安全鲁棒性评估,生成涵盖十类关键内容与安全策略的 7,200 个对抗提示。该框架对开源大语言模型进行黑盒测试,发现模型在不同语言和提示风格下的安全表现存在显著差异,且不同风险类别的脆弱程度不一。现有以英语为中心的安全评估方法存在局限,亟需建立多语言及说服感知的基准框架以更准确评估真实世界中的大语言模型安全性。