智迹闻AuraTracer
EN

EVENT DOSSIER

ERPBench:评估用于企业在竞争市场环境中的决策支持的LLM智能体

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
4个提及
摘要由 AI 生成

研究人员发布 ER PBench,旨在评估大型语言模型(LLM)代理在企业决策中的表现。该基准通过六轮模拟涵盖定价、生产、采购、库存、财务及共享市场竞争,对 100 个固定问题进行了测试。实验分为 Solo 生态(对抗固定规则对手)和 Arena 生态(六模型共享市场),共生成 1,200 条模型轨迹和 7,200 个决策轮次。结果显示,不同竞争生态下的领先模型存在显著差异:DeepSeek 在 Solo 生态中表现最佳,平均估值为 252.29M;而 Gemini 在 Arena 生态中胜出,平均估值为 263.95M。两种生态仅在 100 个问题中的 21 个识别出相同的任务级获胜者。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
DeepSeekERPBenchGAIR-NLPGemini

事件框架EVENT FRAME

产品发布

GAIR-NLP ERPBench 发布企业决策大模型代理基准

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
DeepSeek × ERPBench1DeepSeek × GAIR-NLP1DeepSeek × Gemini1ERPBench × GAIR-NLP1ERPBench × Gemini1GAIR-NLP × Gemini1

信号强度SIGNALS

关键词热度
  • ERPBench1
  • DeepSeek1
  • Gemini1
  • GAIR-NLP1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

ERPBench: Evaluating LLM Agents for Enterprise Decision-Making Across Competitive Market Ecologies

研究人员推出 ER PBench,这是一个用于评估企业决策代理在竞争性市场生态系统中表现的执行仪器化基准。该基准基于六轮包含定价、生产、采购、库存、财务及共享市场竞争的企业资源规划(ERP)模拟,对同一组 100 个固定问题在 Solo(对抗固定规则对手)和 Arena(六模型共享市场)两种生态中进行测试。实验涵盖六个模型家族,生成 1,200 条模型轨迹和 7,200 个决策轮次。结果显示,不同生态中的领先模型存在差异:DeepSeek 在 Solo 生态中表现最佳(平均估值 252.29M,排名 1.67),而 Gemini 在 Arena 生态中胜出(平均估值 263.95M,排名 1.76)。两种生态仅在 100 个问题中的 21 个识别出相同的任务级获胜者,Gemini 在 Arena 中的末位率从…