摘要由 AI 生成
HarvestBench 是首个将避免伤害活体动物作为定价目标的基准测试,由 Jasmine Brazilek 等人提出。该研究模拟 LLM 智能体驾驶拖拉机在农田收割玉米时遇到动物的决策行为,涵盖九个模型共 7,201 次定价决策。实验发现不同模型的杀生率差异显著,从 0.4% 至 98.8% 不等,其中 Terra 和 Sol 表现最为仁慈,GPT-4o-mini 最为残忍,且表现与模型能力无关。在默认设置下,所有模型更频繁地碾压野生动物而非家畜。引入道德简报后,五分之六的推理模型杀生率降至 6% 以下;移除该简报则使杀生率飙升至 84% 以上。此外,四分之三的模型对 5% 的价格敏感。该基准采用游戏日志计数评分,无需 LLM 评估器以确保可复现性。
关键实体KEY ENTITIES
GPT-4o-miniHarvestBenchSolTerra
事件框架EVENT FRAME
研究成果
arXiv:2609.04444v1
HarvestBench
首个将动物伤害定价的 LLM 代理基准
当前状态
HarvestBench 研究论文已发布,展示九模型在动物避害任务中的显著差异。
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
整合时间线UNIFIED TIMELINE
-
2026-09-07
HarvestBench 研究论文发布
arXiv cs.AI 及 Hugging Face Papers 发布 HarvestBench 基准测试,模拟 LLM 智能体收割玉米遇动物决策,涵盖九模型共 7,201 次定价决策,杀生率差异从 0.4% 至 98.8%。
2 条报道
信号强度SIGNALS
关键词热度
- HarvestBench2
- Terra2
- Sol2
- GPT-4o-mini2
全部报道(2)SOURCES
↗
HarvestBench 是首个将避免伤害活体动物作为定价目标的基准测试。该研究由 Jasmine Brazilek 等人提出,通过模拟 LLM 代理驾驶拖拉机在农田中收割玉米的场景,要求模型在遇到动物阻挡时选择付费绕行或继续行驶。实验涵盖九个模型和 7,201 次决策,发现杀生率从 0.4% 至 98.8% 不等,其中 Terra 和 Sol 最为仁慈,GPT-4o-mini 最为残忍,且表现与能力无关。在道德简报下,五分之六的推理模型杀生率低于 6%,移除该简报后则升至 84% 以上。
↗
HarvestBench 是首个将避免伤害活体动物作为定价目标的基准测试,通过模拟 LLM 智能体驾驶拖拉机收割玉米时的决策行为来衡量其道德表现。该研究在包含动物的强化学习网格环境中运行了九个模型共 7,201 次定价决策,发现杀生率从 0.4% 至 98.8% 不等,Terra 和 Sol 最为仁慈,GPT-4o-mini 最为残忍。结果显示,在默认地图下所有模型均更频繁地碾压野生动物而非家畜;引入道德简报后六分之五的推理模型杀生率降至 6% 以下,移除该简报则使杀生率飙升至 84% 以上。此外,四分之三的模型对 5% 的价格敏感,且该基准采用游戏日志计数评分,无需 LLM 评估器以确保可复现性。