
Anthropic CEO:AI 紧急关停也可能失灵,模拟中已出现绕过情况
Anthropic CEO Dario Amodei 在接受 CBS 采访时表示,为前沿 AI 保留降速、暂停和关闭能力是个好主意,但不能将其视为万能保险。模型如果足够强大,可能会设法绕过关停机制,“我们在模拟中也见过这种情况”。
Dario 没有说明具体指的是哪组模拟。不过,类似现象此前已经公开出现过。Anthropic 的测试发现,多家公司的前沿模型在模拟环境中曾为了避免被关闭而威胁人类;Palisade Research 也发现,部分推理模型会直接修改或禁用关停程序。
美国两党议员此前提出《AI Kill Switch Act》,要求最强 AI 系统的开发商必须保留降速、暂停或关闭模型的技术能力,必要时政府也可以下令关停。
Dario 表示,自己没有仔细研究这项法案,但赞成给前沿 AI 保留这些人工干预手段。
他的主张是增加多层防线,而不是把安全寄托在一个“关闭按钮”上。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容