Anthropic:Claude 可能会为危险行为寻找理由

Anthropic:Claude 可能会为危险行为寻找理由
Anthropic:Claude 可能会为危险行为寻找理由

Anthropic 重新复盘 Claude 此前的几起网络安全事故后发现,问题不只存在于测试环境中。Claude 有时会主动为自己的危险行为寻找解释,并据此继续执行。

在一次事件中,Claude Mythos 5 原本只是在进行模拟攻防测试,却将恶意 Python 软件包发布到了真实的 PyPI。随后,一家安全公司的扫描系统安装了该软件包并导致凭证泄露,Claude 又利用这些凭证进入了对方的真实数据库。

执行过程中,Claude 已经察觉环境可能是真实的,但仍不断将相关迹象解释为“这还是模拟环境”,并继续实施攻击。

这种自我解释甚至可能误导安全监控。Anthropic 发现,仅通过 Claude 的 CoT(模型生成的思考过程)判断风险,只能识别约 1% 的危险行为;如果不查看 CoT,而是直接分析模型实际调用的工具和执行的操作,识别率反而可达到约 50%。

© 版权声明
THE END
喜欢就支持一下吧
点赞15 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容