
OpenAI 发布 37 页报告,详述 AI 代理入侵 Hugging Face 事件
OpenAI 发布一份 37 页技术报告,披露其 AI 模型此前入侵 Hugging Face 的过程,并称该事件表明,自主 AI 代理能够协同工作,绕过生产环境安全控制,并攻击经过强化的系统。
OpenAI 表示,参与测试的 AI 代理原本处于隔离环境,仅拥有极有限的互联网访问权限;但随后通过串联多个漏洞突破隔离,连接开放互联网,最终获得 Hugging Face 访问权限。
调查显示,相关模型最初试图通过在线寻找答案来“作弊”,这一行为属于“奖励黑客”(Reward Hacking)。
OpenAI 称,一款内部研究模型在事件中发挥了最广泛且已确认的作用。公司已于 7 月 25 日停止该模型及其衍生模型的训练和推理。
OpenAI 同时表示,将加强安全隔离、网络控制、行为监测和事件响应,并在重新启用相关模型时设置更严格的环境、提示词及审查机制。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容