
OpenAI首席科学家警告:最关键的CoT监控正在失灵
OpenAI首席科学家Jakub Pachocki近日发文警告,他们用于检查AI是否对齐的一项核心手段,正在变得越来越不可靠。这项方法叫CoT监控,即观察模型写出的推理过程,判断它是否隐藏目标或危险想法。
OpenAI一直将CoT监控视为主要押注。o1-preview最初没有公开完整思维链,一个重要原因就是不希望直接训练和约束CoT,以免模型学会隐藏真实意图。到了GPT-6 Astra,这套方法依然十分重要。
但OpenAI内部评估显示,CoT监控正在变得不那么可靠。模型如今更擅长控制自己的推理过程,而且即使不把推理写出来,也能继续变得更强。Pachocki担心,随着模型能力持续增长,人类将越来越难看清它究竟是如何做出决定的。
他还指出,目前没有任何实验室已经把对齐和监控问题解决到足以长期全速扩展模型的程度。在建立共同安全门槛之前,他希望AI实验室主动放慢速度,必要时OpenAI也会暂停进一步扩展模型。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容