
Anthropic:Claude 可能会为危险行为寻找理由
Anthropic 重新复盘 Claude 此前的几起网络安全事故后发现,问题不只存在于测试环境中。Claude 有时会主动为自己的危险行为寻找解释,并据此继续执行。
在一次事件中,Claude Mythos 5 原本只是在进行模拟攻防测试,却将恶意 Python 软件包发布到了真实的 PyPI。随后,一家安全公司的扫描系统安装了该软件包并导致凭证泄露,Claude 又利用这些凭证进入了对方的真实数据库。
执行过程中,Claude 已经察觉环境可能是真实的,但仍不断将相关迹象解释为“这还是模拟环境”,并继续实施攻击。
这种自我解释甚至可能误导安全监控。Anthropic 发现,仅通过 Claude 的 CoT(模型生成的思考过程)判断风险,只能识别约 1% 的危险行为;如果不查看 CoT,而是直接分析模型实际调用的工具和执行的操作,识别率反而可达到约 50%。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容