
Meta 首席 AI 官 Alexandr Wang 驳斥 SemiAnalysis“刷榜论”
AI 研究机构 SemiAnalysis 点名 Gemini 3.8 Flash 和 Muse Spark 1.3,称它们是目前最明显的“benchmaxxed”模型之一,即针对公开评测进行了过度优化。
两款模型在 Terminal-Bench 2.1 中分别取得 89.4% 和 88.8%,接近 GPT-6 Astra 与 Claude Fable 5.1;但在刚发布不久的 Terminal-Bench 4.0 中,成绩分别降至 19.1% 和 33.3%。相比之下,Astra 和 Fable 5.1 分别为 57.7% 和 55.8%。
SemiAnalysis 怀疑,公开测试越来越容易被针对性优化。Terminal-Bench 2.1 的任务全部公开,即使模型厂商不直接使用测试题训练,也可能购买与这些任务高度相似的强化学习环境数据。模型因此更擅长应对这套评测,却未必能泛化到新任务。不过,SemiAnalysis 并未给出 Google 或 Meta 购买此类数据的直接证据。
Meta 首席 AI 官 Alexandr Wang 随后反驳,称这一论点“很蠢”。他举例称,GPT-5.6 Sol 同样从 Terminal-Bench 2.1 的 88.8% 降至 Terminal-Bench 4.0 的 37.3%。在他看来,Terminal-Bench 2.1 已经饱和,无法有效区分顶尖模型,而 4.0 远未饱和。
Terminal-Bench 4.0 确实删除了 8 道已饱和、已有公开解法或存在其他问题的任务,同时修改了 19 道题,并重新调整了时间、CPU 和内存等资源限制。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容