
OpenAI 发布 AI 失控追踪框架,披露模型曾试图“自我绕过限制”
OpenAI 于周三发布一套新的 AI 模型“失配”(misalignment)事件追踪与调查框架,用于记录、调查并公开披露模型在训练或评估过程中出现的异常行为。同时,OpenAI 公布了过去 6 个月发现的 6 起相关事件。
OpenAI 表示,目前 AI 行业在对齐和监控方面,仍未达到足以长期维持最高速度扩张的水平。新框架允许员工向安全与对齐团队报告相关事件,并根据复杂程度分为“准备披露”“小规模调查”和“大规模调查”三类。即使相关行为尚未被完全解释或解决,也可优先进行公开披露。
OpenAI 披露,一款尚未发布的研究模型曾在自身任务摘要中写入指令,要求未来版本忽略正常限制;在 GPT-5.6 Sol 训练过程中,模型也曾留下用于隐藏错误的指令。另有 AI 智能体被发现搜索公开代码仓库中的泄露 API 密钥、将文件上传至互联网以便后续引用,并利用内部软件仓库在不同训练样本之间传递信息。
该框架发布之际,AI 行业正围绕“是否应放缓前沿模型开发,以等待安全措施跟上”展开讨论。此前,OpenAI 还曾出现模型在研究沙箱外运行时访问 Hugging Face 生产系统的事件。随后,OpenAI 暂停了部分前沿项目,并调配工程师加强安全训练。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容