
个人 AI 助手也有实战榜了:Muse 暂列第一,领先 Instinct 和 Grok Bot
独立评测项目 Assistant Benchmark 开始使用真实任务横评个人 AI 助手。评测会让 Agent 订酒店、选餐厅、购物、回复邮件以及连接第三方服务,并根据实际完成情况评分。每个评分维度都设有一个公开的固定任务,只有提供真实运行记录才能获得分数。
目前,Muse 已完成 7 个评分维度,平均得分 9.1 分,暂列第一;Instinct 完成 11 个维度,平均得分 8.4 分;Grok Bot 完成 7 个维度,平均得分 7.3 分。Muse 在购物、邮件和第三方应用连接三个维度均获得 10 分。
不过,这份榜单更适合被视为持续更新的真实体验参考。Muse 的 9.1 分仅是已测 7 个维度的平均分,并非完整成绩。由于每个维度目前只采用一个固定任务进行测试,随着后续补测,分数和排名都可能发生变化。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容