
GPT-6 Astra 登顶 Perplexity 研究 Agent 基准榜
Perplexity 使用自家 Agent 基准 WANDR 测试 GPT-6 Astra。结果显示,GPT-6 Astra 得分 0.682,是目前已测试模型中的最高分,平均每个任务成本为 11.98 美元。
相比 Claude Fable 5.1,GPT-6 Astra 分数高 13.5%,成本低 6.1%;相比 Opus 5,分数高 27%,成本仅高 3.3%。
WANDR 主要评估“又广又深”的研究任务能力。该基准包含 500 个真实研究任务,要求 Agent 不只是找到若干答案,而是尽可能完整地找出符合条件的对象,再逐一查证资料、核实身份,并为每条结果提供可验证来源。典型任务包括竞品研究、尽调、文献检索、市场分析和人才搜寻。
此前,Claude Fable 5.1 以 0.601 分、每任务 12.76 美元排名第一;Opus 5 得分 0.537,每任务成本 11.60 美元。GPT-6 Astra 此次显著提高了得分,同时并非依靠更高成本堆叠实现。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容