OpenAI 发布 AI 失控追踪框架,披露模型曾试图“自我绕过限制”

OpenAI 发布 AI 失控追踪框架,披露模型曾试图“自我绕过限制”
OpenAI 发布 AI 失控追踪框架,披露模型曾试图“自我绕过限制”

OpenAI 于周三发布一套新的 AI 模型“失配”(misalignment)事件追踪与调查框架,用于记录、调查并公开披露模型在训练或评估过程中出现的异常行为。同时,OpenAI 公布了过去 6 个月发现的 6 起相关事件。

OpenAI 表示,目前 AI 行业在对齐和监控方面,仍未达到足以长期维持最高速度扩张的水平。新框架允许员工向安全与对齐团队报告相关事件,并根据复杂程度分为“准备披露”“小规模调查”和“大规模调查”三类。即使相关行为尚未被完全解释或解决,也可优先进行公开披露。

OpenAI 披露,一款尚未发布的研究模型曾在自身任务摘要中写入指令,要求未来版本忽略正常限制;在 GPT-5.6 Sol 训练过程中,模型也曾留下用于隐藏错误的指令。另有 AI 智能体被发现搜索公开代码仓库中的泄露 API 密钥、将文件上传至互联网以便后续引用,并利用内部软件仓库在不同训练样本之间传递信息。

该框架发布之际,AI 行业正围绕“是否应放缓前沿模型开发,以等待安全措施跟上”展开讨论。此前,OpenAI 还曾出现模型在研究沙箱外运行时访问 Hugging Face 生产系统的事件。随后,OpenAI 暂停了部分前沿项目,并调配工程师加强安全训练。

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容