又一条 RSI 路线:模型参数不变,Agent 依靠 Memory 持续改进

又一条 RSI 路线:模型参数不变,Agent 依靠 Memory 持续改进
又一条 RSI 路线:模型参数不变,Agent 依靠 Memory 持续改进

UCSD 助理教授黄碧薇创办的因果世界模型公司 Aether AI 开源了 RSIAgent。

这是一套不训练模型的递归自我改进框架。底层模型参数始终保持不变,Agent 会自行寻找值得练习的任务,实际操作并检查结果,再将成功方法和失败教训写入长期 Memory。下一轮继续利用这些经验,逐步弥补能力短板。

系统由三个 Agent 协同完成:

Curriculum Agent 决定接下来练习什么;Actor Agent 负责实际操作软件;Verifier Agent 独立检查任务结果。

探索过程分为两步:首先广泛尝试不同任务,随后针对失败案例、隐藏限制和边界情况进行深入探索。最后,Memory 会被冻结,并直接用于执行正式任务。

在 OSWorld 2.0 上,加入这套 RSI 后,平均部分得分从 71.97% 提升至 78.98%;Agents’ Last Exam 得分从 83.75% 提升至 84.82%。

不过,这并不是整套测试的严格 A/B 对比。OSWorld 只有一半任务实际采用了加入 RSI 后的新结果,其余任务继续沿用原有成绩。

RSIAgent 与 Prime Agent 等 Harness 自我改进思路属于同一大方向:模型权重保持不变,持续更新模型之外的组件。RSIAgent 的特点是将改进重点放在 Memory 上,并通过自主出题与独立验证,让这套外部经验库持续积累。

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容