
OpenAI 被指调整 GPT-6 Astra 评测数据,部分竞争对手指标下滑
OpenAI 自 9 月 3 日发布 GPT-6 Astra 后,多项模型评测基准数据被持续调整。部分修改使 Astra 的表现更优,同时部分竞争对手模型成绩出现下滑,引发外界对 AI「刷榜」和评测透明度的质疑。
其中,Astra 的幻觉率曾从 4.2% 下调至 2%,GPT-5.6 Sol 则从 12.2% 降至 9.4%,随后两者又恢复至 4.2% 和 12.2%。在数学评测中,Anthropic 的 Fable 5.1 得分曾从 87.8% 降至 78%,目前回升至 83%;GPT-5.6 Sol 则从 83% 降至 80.5%,后恢复至 83%。
此外,Astra 在 ARC-AGI-3 评测中的成绩,从发布前草稿的 98.6% 提升至最终页面的 99.99%;其编程评测成绩也从 57.7% 小幅上调至 57.9%。
OpenAI 表示,评测结果会受到模型版本、工具配置、推理级别及测试运行等因素影响,此次调整是为确保数据更准确地反映模型的最佳性能。
不过,斯坦福大学研究人员认为,频繁重新运行评测可能涉及所谓「Benchmaxxing」,即通过调整测试条件最大化基准成绩。业内人士指出,随着 AI 模型竞争加剧,评测数据已成为衡量模型能力及争夺市场的重要工具,如何提高基准测试的透明度和可复现性,正受到越来越多关注。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容