Artificial Analysis 重做智能榜:私有测试权重升至 40%

Artificial Analysis 重做智能榜:私有测试权重升至 40%
Artificial Analysis 重做智能榜:私有测试权重升至 40%

Artificial Analysis 更新 Intelligence Index v4.2,目标是让榜单更难被针对性刷分。新版将私有测试权重从 20% 提升到 40%,由于模型厂商无法提前看到完整测试集,Benchmark 专门优化的空间被进一步压缩。

新版还加入了 AA-Briefcase 和 GDP.pdf。AA-Briefcase 模拟持续数周的真实知识工作项目,要求模型处理大量关联任务和数千份文件。GDP.pdf 则基于 100 份、共 4592 页的专业 PDF 出题,要求模型跨文本、表格、图表和脚注寻找证据并作答。

GPQA Diamond 被移出综合指数。Artificial Analysis 认为,这一研究生级科学问答测试已接近饱和:GPT-6 Astra 最高达到 96.3%,Gemini 3.8 Flash 也达到 95.3%,已难以继续区分最强模型。

重新计算后,Claude Fable 5.1 仍位居第一,GPT-6 Astra 排名第二。Astra 得分 55,较 GPT-5.6 Sol 高 4 分。Artificial Analysis 还表示,Astra 在同级前沿模型中使用了更少的输出 Token。

© 版权声明
THE END
喜欢就支持一下吧
点赞9 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容