摘要由 AI 生成
研究人员发布 ER PBench,旨在评估大型语言模型(LLM)代理在企业决策中的表现。该基准通过六轮模拟涵盖定价、生产、采购、库存、财务及共享市场竞争,对 100 个固定问题进行了测试。实验分为 Solo 生态(对抗固定规则对手)和 Arena 生态(六模型共享市场),共生成 1,200 条模型轨迹和 7,200 个决策轮次。结果显示,不同竞争生态下的领先模型存在显著差异:DeepSeek 在 Solo 生态中表现最佳,平均估值为 252.29M;而 Gemini 在 Arena 生态中胜出,平均估值为 263.95M。两种生态仅在 100 个问题中的 21 个识别出相同的任务级获胜者。
关键实体KEY ENTITIES
DeepSeekERPBenchGAIR-NLPGemini
事件框架EVENT FRAME
产品发布
GAIR-NLP
ERPBench
发布企业决策大模型代理基准
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- ERPBench1
- DeepSeek1
- Gemini1
- GAIR-NLP1
全部报道(1)SOURCES
↗
研究人员推出 ER PBench,这是一个用于评估企业决策代理在竞争性市场生态系统中表现的执行仪器化基准。该基准基于六轮包含定价、生产、采购、库存、财务及共享市场竞争的企业资源规划(ERP)模拟,对同一组 100 个固定问题在 Solo(对抗固定规则对手)和 Arena(六模型共享市场)两种生态中进行测试。实验涵盖六个模型家族,生成 1,200 条模型轨迹和 7,200 个决策轮次。结果显示,不同生态中的领先模型存在差异:DeepSeek 在 Solo 生态中表现最佳(平均估值 252.29M,排名 1.67),而 Gemini 在 Arena 生态中胜出(平均估值 263.95M,排名 1.76)。两种生态仅在 100 个问题中的 21 个识别出相同的任务级获胜者,Gemini 在 Arena 中的末位率从…