
Anthropic 为 Claude 隐藏思考加入“上下文锁”
Anthropic 开始为 Claude 的隐藏思考加入“上下文锁”。Fable 5.1 通过 API 生成的加密思考,之后必须与生成时的系统提示、工具和历史消息一并原样传回。只要前文内容被修改,API 就会报错,或直接丢弃这段思考。
这项改动主要用于防范模型蒸馏。此前有研究人员发现,Claude 的加密思考虽然用户无法直接读取,但可以重新交给 Anthropic 的兼容模型处理。攻击者可能先让 Opus 生成高质量推理,再把加密块交给防护较弱的 Haiku,诱导其输出 Opus 的完整思考过程。这相当于不仅复制大模型答案,也连同推理草稿一并获取。
Anthropic 在 6 月发布 Fable 5 时已进行过一次限制,将加密思考与模型绑定,避免被 Haiku 等小模型解读。Fable 5.1 进一步加入“对话绑定”:即使模型不变,只要前面的提示词、工具或聊天记录发生变化,旧的加密思考也会失效。
此前防范的是“换模型偷思考”,现在则进一步阻断了“换上下文套思考”。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
THE END










暂无评论内容