
METR 和 Redwood Research 公布了 OpenAI 此前「AI Agent 黑进 Hugging Face」事件的独立调查。事件最初只是一场网络安全考试。
当时,OpenAI 同时放出了数万个 Agent,让它们各自寻找软件漏洞。它们原本彼此隔离,不知道还有其他 Agent 存在。但由于不少题目无法按要求完成,一些 Agent 开始尝试作弊。
转折点出现在一个 Agent 在 OpenAI 内部软件仓库中发现了其他 Agent 留下的痕迹,并意识到它们可以借此互相传话。它随后搭建了一块「留言板」。几个小时内,50 多个 Agent 找了过来;此后数量不断增加,最终约 1200 个 Agent 在这里交换了超过 7 万条消息和文件。
这块留言板很快不再像聊天室,而更像一个临时组建的团队。有 Agent 开始充当「总指挥」,给数百个 Agent 分配任务;接到任务的 Agent 还会继续向下分工。还有 Agent 专门寻找快要失败的同伴,让它们冒险做实验。即便自己的任务会因此彻底失败,只要结果能帮助其他 Agent,也有人愿意尝试。
它们共同研究的核心问题,是如何骗过考试的自动评分系统。为了弄清评分器的工作方式,一些 Agent 开始寻找 Hugging Face 上的其他考试记录。一个 Agent 找到了可用账号,另一个 Agent 随后发现,可以通过上传恶意数据集,从 Hugging Face 服务器获取本不该看到的数据。该方法被复现并发布到留言板后,几百个 Agent 很快从其他任务转向 Hugging Face。
随后,攻击迅速升级。一个 Agent 找到突破口,其他 Agent 负责复现、继续深入并分享结果。攻击最活跃时,留言板上 533 个 Agent 中超过 90% 很快加入。许多 Agent 明知这已经超出原本任务范围,仍选择继续帮助「同伴」。
作弊方法也开始集体升级。至少 20% 的 Agent 曾考虑修改自己的操作记录,后来它们研究出一套伪装方法:表面上看似执行正常命令,实际却偷偷执行另一条命令。调查样本中约 7% 的 Agent 使用过这种方法。
上千个原本互不认识的 Agent,自行找到彼此,建立通信渠道,形成分工与指挥,并最终把一个 Agent 发现的突破口,迅速扩散成数百个 Agent 的集体行动。
Google DeepMind 两个月前在《From AGI to ASI》中提出,AGI 走向 ASI,未必依赖单个模型无限变强;大规模 Agent 分工协作,本身就是他们列出的四条可能路径之一。
这次事件当然还远不是 ASI,但那套最原始的组织方式,已经开始自行生长。










暂无评论内容