摘要由 AI 生成
Harbor 团队于 2026 年 9 月 7 日发布 Harbor Adapters 和 Harbor-Index,旨在构建大规模智能体(Agent)评估体系。Harbor Adapters 提供统一基础设施,支持将超过 80 个基准测试适配至任意 Agent 评测,并通过代码审查与对等实验验证了 Benchmark Adapters 的有效性。研究团队对涵盖 54 个基准的 8 个模型进行了大规模评估,所有模型均使用 Terminus-2 及三种原生 Harness 运行。此外,团队推出了 Harbor-Index,这是一个包含 82 个高难度、多样化任务的精选元数据集。该数据集源自适配套件经难度过滤、AI 与人工审计及“审计 - 修复”循环提炼而成,保留了大规模评估的挑战性与广度且运行成本可控。在所有模…
关键实体KEY ENTITIES
CodexGPT-5.5Harbor AdaptersHarbor-IndexTerminus-2
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Harbor Adapters1
- Harbor-Index1
- Terminus-21
- GPT-5.51
- Codex1
全部报道(1)SOURCES
↗
Harbor Adapters 发布统一评估基础设施,支持将超 80 个基准测试适配用于任意 Agent 评测。研究团队开发了 Benchmark Adapters 并通过代码审查与对等实验验证;对涵盖 54 个基准的 8 个模型进行了大规模评估,每个模型均使用 Terminus-2 及 3 种原生 Harness 运行。此外,团队引入 Harbor-Index,这是一个包含 82 个高难度、多样化任务的精选元数据集,源自适配套件经难度过滤、AI 与人工审计及“审计 - 修复”循环提炼而成。该数据集保留了大规模评估的挑战性与广度且运行成本可控,所有模型-Harness 配置通过率均不超过 30%,最强组合(GPT-5.5 with Codex)达到 28.0%。相关适配器、评测结果、深度分析及 Harbor-…