智迹闻AuraTracer
EN

EVENT DOSSIER

Harbor Adapters and Harbor-Index:用于大规模代理评估的基础设施与精心设计的元数据集

2026-09-07 12:00 大模型 🔥 42.2 事件热度
1家信源
1天持续发酵
42.2事件热度
5个提及
摘要由 AI 生成

Harbor 团队于 2026 年 9 月 7 日发布 Harbor Adapters 和 Harbor-Index,旨在构建大规模智能体(Agent)评估体系。Harbor Adapters 提供统一基础设施,支持将超过 80 个基准测试适配至任意 Agent 评测,并通过代码审查与对等实验验证了 Benchmark Adapters 的有效性。研究团队对涵盖 54 个基准的 8 个模型进行了大规模评估,所有模型均使用 Terminus-2 及三种原生 Harness 运行。此外,团队推出了 Harbor-Index,这是一个包含 82 个高难度、多样化任务的精选元数据集。该数据集源自适配套件经难度过滤、AI 与人工审计及“审计 - 修复”循环提炼而成,保留了大规模评估的挑战性与广度且运行成本可控。在所有模…

相关事件RELATED EVENTS
关键实体KEY ENTITIES
CodexGPT-5.5Harbor AdaptersHarbor-IndexTerminus-2

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Codex × GPT-5.51Codex × Harbor Adapters1Codex × Harbor-Index1Codex × Terminus-21GPT-5.5 × Harbor Adapte…1GPT-5.5 × Harbor-Index1

信号强度SIGNALS

关键词热度
  • Harbor Adapters1
  • Harbor-Index1
  • Terminus-21
  • GPT-5.51
  • Codex1

全部报道(1)SOURCES

A arXiv cs.AI en 2026-09-07 12:00

Harbor Adapters and Harbor-Index:用于大规模代理式评估的基础设施与精心设计的元数据集

Harbor Adapters 发布统一评估基础设施,支持将超 80 个基准测试适配用于任意 Agent 评测。研究团队开发了 Benchmark Adapters 并通过代码审查与对等实验验证;对涵盖 54 个基准的 8 个模型进行了大规模评估,每个模型均使用 Terminus-2 及 3 种原生 Harness 运行。此外,团队引入 Harbor-Index,这是一个包含 82 个高难度、多样化任务的精选元数据集,源自适配套件经难度过滤、AI 与人工审计及“审计 - 修复”循环提炼而成。该数据集保留了大规模评估的挑战性与广度且运行成本可控,所有模型-Harness 配置通过率均不超过 30%,最强组合(GPT-5.5 with Codex)达到 28.0%。相关适配器、评测结果、深度分析及 Harbor-…