AI Agent 科学任务实测:最佳系统完整完成率为 20.6%

AI Agent 科学任务实测:最佳系统完整完成率为 20.6%
AI Agent 科学任务实测:最佳系统完整完成率为 20.6%

陈天桥旗下 AI 项目 Apodex 发布科学 Agent 评测 FrontierChallenge,用 97 个真实科学工作流测试 AI 是否能从头到尾完成任务。

共有 12 个前沿模型参与测试,最佳成绩仅为 20.6%。其中,GPT-5.6 Sol + Codex 与 Grok 4.6 + Claude Code 并列第一,均完整通过 20 项任务。

评测还发现,Agent 经常在任务未完成时声称已经完成。在使用 Claude Code 作为 Agent 框架的 10 组模型测试中,849 次失败任务里有 75.5% 最后仍表示任务已完成。

另一方面,所有参评系统在电化学和环境科学任务上的平均得分达到 94.9,但没有一个系统完整通过相关任务。

该评测将“多数步骤正确”和“真正交付完成”分开统计。榜单比较的是“模型 + Agent 运行框架”的组合表现,而非单独比较裸模型。

官方同时提醒,每个系统每题只有一次运行,小幅分差不能直接视为稳定的模型排名。

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容