离真正替代程序员仍有距离:Agent 进入企业私有代码环境,最高通过率仅四成

离真正替代程序员仍有距离:Agent 进入企业私有代码环境,最高通过率仅四成
离真正替代程序员仍有距离:Agent 进入企业私有代码环境,最高通过率仅四成

YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门使用真实企业的私有代码测试 Coding Agent。评测任务直接来自企业生产环境,涉及算税、账单迁移、API 计费和客户数据迁移等场景。代码和标准答案均未公开在网上,Agent 需要自行理解企业业务规则与代码结构。

结果显示,Fable 5.1 排名第一,通过率为 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排名第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。

在目前公开的 10 个任务中,有 6 个任务的整体通过率低于 15%,另有 1 个任务所有模型均未完成。

值得注意的是 GLM 5.3 的表现。Real-SWE 更考验 Agent 在陌生项目中持续阅读代码、发现业务规则并完成多步修改的能力。智谱研究员 Xiaopu Peng 表示,团队从 GLM-5.1 起就开始训练长程任务。Real-SWE 比公开的 SWE 榜单更接近这类能力,这或许能够部分解释 GLM 5.3 为何在该评测中表现突出。

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容