智迹闻AuraTracer
EN

EVENT DOSSIER

GPTNT:在 Keep Talking And Nobody Explodes 上对多模态智能体实时协作进行性能比较》

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
2个提及
摘要由 AI 生成

2026 年 9 月 7 日,arXiv 发布 GPTNT 基准测试报告,评估多模态智能体在《Keep Talking And Nobody Explodes》游戏中的实时协作能力。该测试要求两名智能体在无轮替限制、信息不对称及时间压力的条件下进行异步沟通以拆除炸弹。结果显示,所有测试的开源及闭源模型均未能在倒计时内成功完成任务。研究指出,现有模型在状态跟踪、行动效率、歧义处理及错误恢复方面存在关键弱点。GPTNT 利用游戏程序化生成特性及活跃模组社区,确保基准随模型能力提升而持续演化。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
GPTNTKeep Talking And Nobody Explodes

事件框架EVENT FRAME

产品发布

arXiv:2606.28514v2 GPTNT 基于游戏构建的多模态代理实时协作基准

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
GPTNT × Keep Talking An…1

信号强度SIGNALS

关键词热度
  • GPTNT1
  • Keep Talking And Nobody Explodes1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes

GPTNT 基准测试在《Keep Talking And Nobody Explodes》游戏中评估多模体智能体实时协作能力,结果显示所有测试的开源及闭源模型均未在倒计时内成功拆除炸弹。该基准基于游戏机制构建,要求两名智能体分别持有炸弹和拆弹指令,必须在无轮替限制、信息不对称和时间压力的条件下进行异步实时沟通。研究通过控制实验发现,现有模型在状态跟踪、时间预算内的行动效率、歧义处理及错误恢复方面存在关键弱点。GPTNT 利用游戏程序化生成特性及活跃模组社区,确保基准随模型能力提升而持续演化,避免被一次性破解。