
AI Agent 科学任务实测:最佳系统完整完成率为 20.6%
陈天桥旗下 AI 项目 Apodex 发布科学 Agent 评测 FrontierChallenge,用 97 个真实科学工作流测试 AI 是否能从头到尾完成任务。
共有 12 个前沿模型参与测试,最佳成绩仅为 20.6%。其中,GPT-5.6 Sol + Codex 与 Grok 4.6 + Claude Code 并列第一,均完整通过 20 项任务。
评测还发现,Agent 经常在任务未完成时声称已经完成。在使用 Claude Code 作为 Agent 框架的 10 组模型测试中,849 次失败任务里有 75.5% 最后仍表示任务已完成。
另一方面,所有参评系统在电化学和环境科学任务上的平均得分达到 94.9,但没有一个系统完整通过相关任务。
该评测将“多数步骤正确”和“真正交付完成”分开统计。榜单比较的是“模型 + Agent 运行框架”的组合表现,而非单独比较裸模型。
官方同时提醒,每个系统每题只有一次运行,小幅分差不能直接视为稳定的模型排名。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容