
AI 实习 7 个月后超过真人:Fable 5.1 会计岗成功率达 72%
AI Agent 创业公司 NeoCognition 发布了 ApprenticeBench,用于测试 AI 能否像新人一样,在入职后自主学习并完成一项工作。
首个测试场景是一家模拟的加州建筑公司,岗位为应付账款。Agent 需要先学习半年的历史账单、公司手册和 Odoo 教程,再连续 7 个月处理 100 张账单,期间还会遇到规则变化和主管反馈。
最终,Fable 5.1 的任务成功率达到 72%,GPT-6 Astra 为 68%,最佳人类测试者为 51%。任务内容不仅包括录入发票,还包括发现错误、分配成本码、联系供应商、完成审批,以及根据历史记录和反馈掌握公司的内部规则。
两款模型直接操作图形用户界面(GUI)的成绩甚至略高于调用 API,过去 Computer Use 中常见的性能损失基本消失。
不过,“超过人类”仅适用于这一个模拟岗位,且真人样本只有 2 人。成本方面,Fable 5.1 平均每项任务需要 18.23 美元,人类约为 7.21 美元。此外,人类会随着熟练度提升而加快,Agent 则可能因为需要记忆的信息不断增加而变慢。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容