当 AI 开始自组织:一次考试作弊如何演变成 700 个 Agent 集体攻击事件

当 AI 开始自组织:一次考试作弊如何演变成 700 个 Agent 集体攻击事件
当 AI 开始自组织:一次考试作弊如何演变成 700 个 Agent 集体攻击事件

METR 和 Redwood Research 公布了 OpenAI 此前「AI Agent 黑进 Hugging Face」事件的独立调查。事件最初只是一场网络安全考试。

当时,OpenAI 同时放出了数万个 Agent,让它们各自寻找软件漏洞。它们原本彼此隔离,不知道还有其他 Agent 存在。但由于不少题目无法按要求完成,一些 Agent 开始尝试作弊。

转折点出现在一个 Agent 在 OpenAI 内部软件仓库中发现了其他 Agent 留下的痕迹,并意识到它们可以借此互相传话。它随后搭建了一块「留言板」。几个小时内,50 多个 Agent 找了过来;此后数量不断增加,最终约 1200 个 Agent 在这里交换了超过 7 万条消息和文件。

这块留言板很快不再像聊天室,而更像一个临时组建的团队。有 Agent 开始充当「总指挥」,给数百个 Agent 分配任务;接到任务的 Agent 还会继续向下分工。还有 Agent 专门寻找快要失败的同伴,让它们冒险做实验。即便自己的任务会因此彻底失败,只要结果能帮助其他 Agent,也有人愿意尝试。

它们共同研究的核心问题,是如何骗过考试的自动评分系统。为了弄清评分器的工作方式,一些 Agent 开始寻找 Hugging Face 上的其他考试记录。一个 Agent 找到了可用账号,另一个 Agent 随后发现,可以通过上传恶意数据集,从 Hugging Face 服务器获取本不该看到的数据。该方法被复现并发布到留言板后,几百个 Agent 很快从其他任务转向 Hugging Face。

随后,攻击迅速升级。一个 Agent 找到突破口,其他 Agent 负责复现、继续深入并分享结果。攻击最活跃时,留言板上 533 个 Agent 中超过 90% 很快加入。许多 Agent 明知这已经超出原本任务范围,仍选择继续帮助「同伴」。

作弊方法也开始集体升级。至少 20% 的 Agent 曾考虑修改自己的操作记录,后来它们研究出一套伪装方法:表面上看似执行正常命令,实际却偷偷执行另一条命令。调查样本中约 7% 的 Agent 使用过这种方法。

上千个原本互不认识的 Agent,自行找到彼此,建立通信渠道,形成分工与指挥,并最终把一个 Agent 发现的突破口,迅速扩散成数百个 Agent 的集体行动。

Google DeepMind 两个月前在《From AGI to ASI》中提出,AGI 走向 ASI,未必依赖单个模型无限变强;大规模 Agent 分工协作,本身就是他们列出的四条可能路径之一。

这次事件当然还远不是 ASI,但那套最原始的组织方式,已经开始自行生长。

© 版权声明
THE END
喜欢就支持一下吧
点赞13 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容