
OpenAI 与 Anthropic 产品负责人隔空交锋:提示词注入防护成焦点
Claude Code 负责人 Boris Cherny 发帖称,GPT-6 Astra 的提示词注入防护已经与 Gemini Flash、Claude Opus 4.8「差不多」。他同时表示,Claude 模型约两个月前已在实践中解决了这一问题。
提示词注入是指将恶意指令隐藏在网页、文档等内容中,诱导 Agent 泄露数据或执行危险操作。
Boris 还称,公开评估并点名其他实验室,是推动其训练出更安全模型的有效方式,并表示会继续这样做,直到其他实验室更加重视安全。
该帖随后被 X 添加 Community Note 反驳。Gray Swan 的独立评测显示,没有任何受测模型能够完全免疫提示词注入,Claude 同样存在攻击成功案例。另一名安全研究员还使用特制网页攻击 Claude Code Opus 5 Auto Mode,在小规模测试中取得 60%–80% 的成功率。
OpenAI 核心产品负责人 Thibault Sottiaux 随后以类似句式回应称,他也很高兴看到 Claude Code 新推出的后台电脑操作终于追上 Codex,「而且是我们今年 5 月的版本」。
Boris 后来承认,原帖语气「比自己想要的更阴阳」,并强调自己确实是在肯定 Astra 的进步。他同时澄清,所谓提示词注入已经「解决」,指的是 Claude 模型、注入检测机制与 Auto Mode 组合后的产品效果,并不意味着模型本身已经免疫。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容