谷歌让 Agent 学会“做梦”:复盘过去试错,下一轮少走弯路

谷歌让 Agent 学会“做梦”:复盘过去试错,下一轮少走弯路
谷歌让 Agent 学会“做梦”:复盘过去试错,下一轮少走弯路

谷歌研究团队发布了 Dream-RSI,让 AI Agent 在完成一轮任务后,复盘过去的成功与失败。系统会保存每次尝试及其结果,再利用这些历史记录推演不同的执行方式,例如先尝试哪条路径、何时放弃,以及是否需要同时测试多个方案。由于相关结果此前已经执行过,这些推演不必重新运行任务。

系统会从推演结果中选出表现更好的策略,并直接应用到下一轮。新一轮执行后,又会产生更多成功与失败记录,供系统继续复盘和调整策略。论文将这一过程称为“递归自我改进”。

目前,底层模型本身不会发生变化,真正得到改进的是 Agent 决定下一步行动的方法。

论文在算法、数学优化和 GPU kernel 等 8 个任务上测试了这套方法。以 Gemini 3.1 Pro 完成的一项算法任务为例,与固定执行方式相比,Agent 的调用次数从 550 次降至 317 次,同时最终找到的程序运行速度更快。

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容