智迹闻AuraTracer
EN

EVENT DOSSIER

OpenAI多次修改GPT-6 Astra基准测试数据,部分成绩一度大幅变化

2026-09-06 08:00 大模型 🔥 60.2 事件热度 hn #1producthunt #2v2ex #7
1家信源
1天持续发酵
60.2事件热度
5个提及
摘要由 AI 生成

2026 年 9 月 3 日,OpenAI 发布 GPT-6 模型在 Astra 基准测试中的成绩后,随后多次修改相关数据。该模型的幻觉率从初始的 4.2% 降至 2%,后又回升至 4.2%,数学、网络安全及代码能力等指标亦经历反复调整。OpenAI 表示修正数据旨在确保数字代表模型可用性能的最佳估计,并指出测试条件(如工具框架)会影响结果。此次事件导致竞争对手 Anthropic 旗下 Fable 5.1 和 Opus 5 的部分成绩也出现波动。业界对此引发讨论,部分专家认为反复调整测试条件可能出于营销目的,且技术细节披露不足。此前 Meta 也曾被指修饰过 Llama 4 的评测成绩,行业正面临如何标准化衡量大模型能力的长期挑战。

相关事件RELATED EVENTS
关键实体KEY ENTITIES
AnthropicFortuneIT之家OpenAISam Altman

事件框架EVENT FRAME

产品发布

OpenAI Astra 发布新大模型引发AGI争议

报道态势 · 每日报道量LANGUAGE SPLIT

实体关系
Anthropic × Fortune1Anthropic × IT之家1Anthropic × OpenAI1Anthropic × Sam Altman1Fortune × IT之家1Fortune × OpenAI1

信号强度SIGNALS

关键词热度
  • OpenAI1
  • Anthropic1
  • Fortune1
  • IT之家1
  • Sam Altman1

全部报道(1)SOURCES

凤凰网·科技 zh 2026-09-06 08:00

OpenAI多次修改GPT-6 Astra基准测试数据,部分成绩一度大幅变化

OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化。自当地时间 9 月 3 日下午首次发布公告以来,Astra 的幻觉率从 4.2% 降至 2% 后又回升至 4.2%,其数学能力、网络安全及代码能力等指标亦经历多次调整。OpenAI 表示修正数据是为了确保数字代表模型可用性能的最佳估计,以便用户进行有意义比较,并强调测试条件(如工具框架)会影响结果。与此同时,竞争对手 Anthropic 旗下模型 Fable 5.1 和 Opus 5 的部分成绩也出现波动。此次事件引发业界对“刷分”现象的讨论,部分专家认为反复调整测试条件可能出于营销目的,且相关技术细节披露不足。此前 Meta 也曾被指修饰过 Llama 4 的评测成绩,行业正面临如何标准化衡量大模型能力的长期挑战。