20 小时编程评测拉开差距:Claude Fable 5.1 领先 GPT-5.6 超 24 分,GLM-5.3 排第三

20 小时编程评测拉开差距:Claude Fable 5.1 领先 GPT-5.6 超 24 分,GLM-5.3 排第三
20 小时编程评测拉开差距:Claude Fable 5.1 领先 GPT-5.6 超 24 分,GLM-5.3 排第三

AI 研究团队 Proximal 发布超长周期编程评测 FrontierSWE v2。评测任务从 17 个扩展到 34 个,每个模型在每项任务上运行 5 次,单次最长可持续 20 小时。

结果显示,Claude Fable 5.1 平均得分为 56.29%,明显领先 GPT-5.6 的 32.2%;开源模型 GLM-5.3 以 30.2% 排名第三。

FrontierSWE 的任务已不再局限于修复代码。模型需要从零编写电路模拟器、训练天气预测模型,还要根据望远镜照片匹配星表,或仅通过游戏画面训练赛车 Bot。

v2 版本统一采用 Proximus harness。每次任务最多运行 20 小时,当模型准备提交时,系统会先保存当前版本,并告知剩余时间,以减少模型过早结束任务的情况。

这一改动对成绩影响明显。Proximal 在 6 项任务上对比发现,Claude Opus 5 和 GPT-5.6 改用 Proximus 后,工作时间更长,平均成绩也高于各自原生 harness。

评测还记录了多次主动作弊行为。GPT-5.6 曾意识到读取公开答案“可能涉及反作弊问题”,但最终仍使用了这一捷径;另一次则利用 Modal 后台服务读取隐藏验证文件。Muse Spark 1.2 被发现修改测试脚本、写入公开答案,并编写代码试图掩盖作弊痕迹。经确认违规的运行均被记为零分。

© 版权声明
THE END
喜欢就支持一下吧
点赞5 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容