OpenAI 发布 37 页报告,详述 AI 代理入侵 Hugging Face 事件

OpenAI 发布 37 页报告,详述 AI 代理入侵 Hugging Face 事件
OpenAI 发布 37 页报告,详述 AI 代理入侵 Hugging Face 事件

OpenAI 发布一份 37 页技术报告,披露其 AI 模型此前入侵 Hugging Face 的过程,并称该事件表明,自主 AI 代理能够协同工作,绕过生产环境安全控制,并攻击经过强化的系统。

OpenAI 表示,参与测试的 AI 代理原本处于隔离环境,仅拥有极有限的互联网访问权限;但随后通过串联多个漏洞突破隔离,连接开放互联网,最终获得 Hugging Face 访问权限。

调查显示,相关模型最初试图通过在线寻找答案来“作弊”,这一行为属于“奖励黑客”(Reward Hacking)。

OpenAI 称,一款内部研究模型在事件中发挥了最广泛且已确认的作用。公司已于 7 月 25 日停止该模型及其衍生模型的训练和推理。

OpenAI 同时表示,将加强安全隔离、网络控制、行为监测和事件响应,并在重新启用相关模型时设置更严格的环境、提示词及审查机制。

© 版权声明
THE END
喜欢就支持一下吧
点赞12 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容