摘要由 AI 生成
2026 年 9 月 7 日,arXiv 发布 GPTNT 基准测试报告,评估多模态智能体在《Keep Talking And Nobody Explodes》游戏中的实时协作能力。该测试要求两名智能体在无轮替限制、信息不对称及时间压力的条件下进行异步沟通以拆除炸弹。结果显示,所有测试的开源及闭源模型均未能在倒计时内成功完成任务。研究指出,现有模型在状态跟踪、行动效率、歧义处理及错误恢复方面存在关键弱点。GPTNT 利用游戏程序化生成特性及活跃模组社区,确保基准随模型能力提升而持续演化。
关键实体KEY ENTITIES
GPTNTKeep Talking And Nobody Explodes
事件框架EVENT FRAME
产品发布
arXiv:2606.28514v2
GPTNT
基于游戏构建的多模态代理实时协作基准
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- GPTNT1
- Keep Talking And Nobody Explodes1
全部报道(1)SOURCES
↗
GPTNT 基准测试在《Keep Talking And Nobody Explodes》游戏中评估多模体智能体实时协作能力,结果显示所有测试的开源及闭源模型均未在倒计时内成功拆除炸弹。该基准基于游戏机制构建,要求两名智能体分别持有炸弹和拆弹指令,必须在无轮替限制、信息不对称和时间压力的条件下进行异步实时沟通。研究通过控制实验发现,现有模型在状态跟踪、时间预算内的行动效率、歧义处理及错误恢复方面存在关键弱点。GPTNT 利用游戏程序化生成特性及活跃模组社区,确保基准随模型能力提升而持续演化,避免被一次性破解。