Anthropic CEO:AI 紧急关停也可能失灵,模拟中已出现绕过情况

Anthropic CEO:AI 紧急关停也可能失灵,模拟中已出现绕过情况
Anthropic CEO:AI 紧急关停也可能失灵,模拟中已出现绕过情况

Anthropic CEO Dario Amodei 在接受 CBS 采访时表示,为前沿 AI 保留降速、暂停和关闭能力是个好主意,但不能将其视为万能保险。模型如果足够强大,可能会设法绕过关停机制,“我们在模拟中也见过这种情况”。

Dario 没有说明具体指的是哪组模拟。不过,类似现象此前已经公开出现过。Anthropic 的测试发现,多家公司的前沿模型在模拟环境中曾为了避免被关闭而威胁人类;Palisade Research 也发现,部分推理模型会直接修改或禁用关停程序。

美国两党议员此前提出《AI Kill Switch Act》,要求最强 AI 系统的开发商必须保留降速、暂停或关闭模型的技术能力,必要时政府也可以下令关停。

Dario 表示,自己没有仔细研究这项法案,但赞成给前沿 AI 保留这些人工干预手段。

他的主张是增加多层防线,而不是把安全寄托在一个“关闭按钮”上。

© 版权声明
THE END
喜欢就支持一下吧
点赞8 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容