摘要由 AI 生成
2026 年 9 月 3 日,OpenAI 发布 GPT-6 模型在 Astra 基准测试中的成绩后,随后多次修改相关数据。该模型的幻觉率从初始的 4.2% 降至 2%,后又回升至 4.2%,数学、网络安全及代码能力等指标亦经历反复调整。OpenAI 表示修正数据旨在确保数字代表模型可用性能的最佳估计,并指出测试条件(如工具框架)会影响结果。此次事件导致竞争对手 Anthropic 旗下 Fable 5.1 和 Opus 5 的部分成绩也出现波动。业界对此引发讨论,部分专家认为反复调整测试条件可能出于营销目的,且技术细节披露不足。此前 Meta 也曾被指修饰过 Llama 4 的评测成绩,行业正面临如何标准化衡量大模型能力的长期挑战。
关键实体KEY ENTITIES
AnthropicFortuneIT之家OpenAISam Altman
事件框架EVENT FRAME
产品发布
OpenAI
Astra
发布新大模型引发AGI争议
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- OpenAI1
- Anthropic1
- Fortune1
- IT之家1
- Sam Altman1
全部报道(1)SOURCES
↗
OpenAI 多次修改 GPT-6 Astra 基准测试数据,部分成绩一度大幅变化。自当地时间 9 月 3 日下午首次发布公告以来,Astra 的幻觉率从 4.2% 降至 2% 后又回升至 4.2%,其数学能力、网络安全及代码能力等指标亦经历多次调整。OpenAI 表示修正数据是为了确保数字代表模型可用性能的最佳估计,以便用户进行有意义比较,并强调测试条件(如工具框架)会影响结果。与此同时,竞争对手 Anthropic 旗下模型 Fable 5.1 和 Opus 5 的部分成绩也出现波动。此次事件引发业界对“刷分”现象的讨论,部分专家认为反复调整测试条件可能出于营销目的,且相关技术细节披露不足。此前 Meta 也曾被指修饰过 Llama 4 的评测成绩,行业正面临如何标准化衡量大模型能力的长期挑战。