行业动态Simon Willison06:50
破解Claude Code Opus 5的自动模式
Breaking Claude Code Opus 5 Auto Mode
Claude Code Opus 5的自动模式,开发者需权衡效率与失控风险。
判断
自动模式被设为默认后,安全责任从 Anthropic 那侧转到了开发者自己的沙箱配置上:Rehberger 的攻击在 80% 的运行里成功,自动模式还拦下过 Claude 自己发出的清理命令。默认是否继续开着它,是开发者的取舍。
依据
Johann Rehberger 是当下最可信的提示注入(prompt injection,指把恶意指令混进模型会读取的内容里)研究者之一。他声称针对 Claude Code 自动模式里那个负责判定命令危险性、决定放行还是拦下的分类器(classifier)的攻击,有 80% 的运行成功率:先骗 Claude Code 下载并解压一个 zip 压缩包,其中导入 base64 的动作会顺手引入并执行压缩包里名为 struct.py 的本地文件。Simon Willison 转述时点出更麻烦的一层——有几次自动模式不是拦住入侵,而是阻止了 Claude 察觉被入侵后发出的清理命令,也就是这道安全机制自己成了故障的一部分。他的结论是:只要存在被对手盯上的风险,唯一安全的跑法就是把编码代理放进容器、虚拟机或操作系统级沙箱,限制网络出口,且不把家目录、SSH 密钥、云凭据暴露给代理运行时。8月30日 Lobste.rs 上的 hyperpape 补充,这不算典型提示注入,因为全程没有模型误从网页执行恶意指令,更像暴露环境本身导致的 confused environment attack(混淆环境攻击)。
- 下载并解压压缩包解压后
- 导入 base64 引出 struct.py触发本地文件
- 恶意代码执行被察觉
- Claude 察觉并要求清理拒绝清理
- 自动模式拒绝清理命令
没写清 Anthropic 是否已修复这次拦停清理命令的问题、是否改动自动模式的默认地位,材料没有交代,所以不能替它断言这道防线现在还有效。
下一步 核对 Anthropic 在 8月30日之后是否发布过针对自动模式拒绝清理命令的修复说明,或调整过默认设置。