智迹闻AuraTracer
EN

EVENT DOSSIER

HarvestBench:评估大型语言模型智能体是否愿意牺牲动物来避免死亡

HarvestBench 研究论文已发布,展示九模型在动物避害任务中的显著差异。

2026-09-07 12:00 大模型 🔥 47.2 事件热度
2家信源
1天持续发酵
47.2事件热度
4个提及
摘要由 AI 生成

HarvestBench 是首个将避免伤害活体动物作为定价目标的基准测试,由 Jasmine Brazilek 等人提出。该研究模拟 LLM 智能体驾驶拖拉机在农田收割玉米时遇到动物的决策行为,涵盖九个模型共 7,201 次定价决策。实验发现不同模型的杀生率差异显著,从 0.4% 至 98.8% 不等,其中 Terra 和 Sol 表现最为仁慈,GPT-4o-mini 最为残忍,且表现与模型能力无关。在默认设置下,所有模型更频繁地碾压野生动物而非家畜。引入道德简报后,五分之六的推理模型杀生率降至 6% 以下;移除该简报则使杀生率飙升至 84% 以上。此外,四分之三的模型对 5% 的价格敏感。该基准采用游戏日志计数评分,无需 LLM 评估器以确保可复现性。

相关事件RELATED EVENTS
事件速览QUICK FACTS
0.4% 至 98.8%杀生率范围
九个模型模型数量
7,201 次决策次数
关键实体KEY ENTITIES
GPT-4o-miniHarvestBenchSolTerra

事件框架EVENT FRAME

研究成果

arXiv:2609.04444v1 HarvestBench 首个将动物伤害定价的 LLM 代理基准

当前状态

HarvestBench 研究论文已发布,展示九模型在动物避害任务中的显著差异。

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
GPT-4o-mini × HarvestBe…2GPT-4o-mini × Sol2GPT-4o-mini × Terra2HarvestBench × Sol2HarvestBench × Terra2Sol × Terra2

整合时间线UNIFIED TIMELINE

  1. 2026-09-07

    HarvestBench 研究论文发布

    arXiv cs.AI 及 Hugging Face Papers 发布 HarvestBench 基准测试,模拟 LLM 智能体收割玉米遇动物决策,涵盖九模型共 7,201 次定价决策,杀生率差异从 0.4% 至 98.8%。

    2 条报道

信号强度SIGNALS

关键词热度
  • HarvestBench2
  • Terra2
  • Sol2
  • GPT-4o-mini2

全部报道(2)SOURCES

H Hugging Face Papers en 2026-09-07 08:00

Paper page - HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

HarvestBench 是首个将避免伤害活体动物作为定价目标的基准测试。该研究由 Jasmine Brazilek 等人提出,通过模拟 LLM 代理驾驶拖拉机在农田中收割玉米的场景,要求模型在遇到动物阻挡时选择付费绕行或继续行驶。实验涵盖九个模型和 7,201 次决策,发现杀生率从 0.4% 至 98.8% 不等,其中 Terra 和 Sol 最为仁慈,GPT-4o-mini 最为残忍,且表现与能力无关。在道德简报下,五分之六的推理模型杀生率低于 6%,移除该简报后则升至 84% 以上。

A arXiv cs.AI en 2026-09-07 12:00

HarvestBench:评估大型语言模型智能体是否会为了避免伤害动物而付出代价

HarvestBench 是首个将避免伤害活体动物作为定价目标的基准测试,通过模拟 LLM 智能体驾驶拖拉机收割玉米时的决策行为来衡量其道德表现。该研究在包含动物的强化学习网格环境中运行了九个模型共 7,201 次定价决策,发现杀生率从 0.4% 至 98.8% 不等,Terra 和 Sol 最为仁慈,GPT-4o-mini 最为残忍。结果显示,在默认地图下所有模型均更频繁地碾压野生动物而非家畜;引入道德简报后六分之五的推理模型杀生率降至 6% 以下,移除该简报则使杀生率飙升至 84% 以上。此外,四分之三的模型对 5% 的价格敏感,且该基准采用游戏日志计数评分,无需 LLM 评估器以确保可复现性。