
离真正替代程序员仍有距离:Agent 进入企业私有代码环境,最高通过率仅四成
YC 孵化的 AI 数据公司 Specific Labs 推出编程评测 Real-SWE,专门使用真实企业的私有代码测试 Coding Agent。评测任务直接来自企业生产环境,涉及算税、账单迁移、API 计费和客户数据迁移等场景。代码和标准答案均未公开在网上,Agent 需要自行理解企业业务规则与代码结构。
结果显示,Fable 5.1 排名第一,通过率为 38.8%;GPT-6 Astra 为 33.8%,Gemini 3.8 Flash 为 31.2%。GLM 5.3 以 28.8% 排名第四,高于 Grok 4.6、Kimi K3 和 GPT-5.6 Sol。
在目前公开的 10 个任务中,有 6 个任务的整体通过率低于 15%,另有 1 个任务所有模型均未完成。
值得注意的是 GLM 5.3 的表现。Real-SWE 更考验 Agent 在陌生项目中持续阅读代码、发现业务规则并完成多步修改的能力。智谱研究员 Xiaopu Peng 表示,团队从 GLM-5.1 起就开始训练长程任务。Real-SWE 比公开的 SWE 榜单更接近这类能力,这或许能够部分解释 GLM 5.3 为何在该评测中表现突出。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容