
OpenAI 发布新一代旗舰模型 GPT-6 Astra,重点能力包括电脑操作和长任务执行。该模型可自主操作网页与软件,连续完成资料查找、表单填写、表格制作、代码编写和测试运行等任务。OpenAI 称其为目前“世界上最聪明、最对齐”的模型。
在官方评测中,Astra 在 FrontierMath Tier 4 中取得 97.6%;在 ARC-AGI-3 验证测试中,配合 OpenAI 的上下文管理机制达到 99.9%,在统一标准框架下为 62.7%。Terminal-Bench 4.0 得分为 57.9%,略高于 Claude Fable 5.1 的 55.8%。
电脑操作方面,Astra 在 OSWorld 2.0 上的成绩从 GPT-5.6 Sol 的 65.7% 提升至 72.6%,模拟任务用时从约 75 分钟降至 40 分钟。配合新版 Codex,Mind2Web 任务速度达到此前的 1.9 倍。
OpenAI 总裁 Greg Brockman 表示,几年后回看,人们可能会将 Astra 或这一时间点视为 AGI 的起点。不过,“世界最聪明”仍是 OpenAI 的自我定位。Artificial Analysis 的独立实测显示,Astra max 的 Intelligence Index 为 61 分,目前排名第 8;Claude Fable 5.1 max 为 66 分,仍处于领先位置。
Astra 也是 OpenAI 首个达到 Critical 网络安全能力门槛的模型。测试期间,它还发现并利用了两处此前未知的零日漏洞。首批版本仅向少量组织开放,Plus、Pro、Business、Enterprise、API 和 AWS 将在未来几天陆续开放。










暂无评论内容