
腾讯 T1 专攻 Agent 长任务:连续操作 300 多轮,跑分提升 20.2 分
腾讯将 Qwen3.5-122B-A10B 用于训练终端 Agent,推出 T1。该模型主要处理 Linux 终端中的复杂任务,单个任务最多可连续调用工具 300 多轮。
在 Terminal-Bench 2.1 上,T1 得分从底模的 43.8% 提升至 64.0%,增加 20.2 个百分点。
这部分提升主要来自强化学习。SFT 阶段仅将分数提升至 49.4%,随后强化学习又带来 14.6 个百分点的增长。团队准备了约 1.5 万个终端任务,每个任务都配有自动测试。即使 Agent 未完成整个任务,只要完成其中部分要求,也能获得相应奖励。
长任务训练还面临训推偏差问题:Agent 实际执行任务时生成的内容,在后续训练中可能被重新切分为不同 token,MoE 也可能调用不同专家处理。T1 会记录当时生成的 token 和选中的专家,并在训练时直接重放,从而将这种训推偏差降低约三分之一。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容