
Qwen3.8-Max 再升级:8 项编程测试均提升,部分超过 Opus 5
阿里千问对刚发布一个月的旗舰模型 Qwen3.8-Max 进行了升级,推出 Qwen3.8-Max-0902。模型参数规模保持不变,仍为 2.4T 参数,并支持 100 万 Token 上下文。
此次升级主要围绕 Coding 和 Cowork 后训练展开,重点补强编程能力、复杂工作流处理,以及长时间 Agent 任务表现。
阿里公布的对比数据显示,Qwen3.8-Max-0902 在 8 项编程评测中均高于原版。其中,TerminalBench 3.0 从 11.3 提升至 29.0,DeepSWE 1.1 从 56.6 提升至 69.3,QwenSWEbench V2 从 55.1 提升至 70.0。职业任务 JobBench 也从 53.4 提升至 64.0。
与 Claude Opus 5 相比,Qwen3.8-Max-0902 在多数编程项目上仍有差距,但在 MLS-Bench-Lite、SWE-Atlas QnA 和 QwenSWEbench V2 三项中超过对方。
多模态方面,Qwen3.8-Max-0902 相比原版仅提升 0.4 至 3 分。整体来看,本轮升级重点集中在提升 Agent 的代码编写和任务执行能力。
上述成绩目前均为阿里自测。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容