行业动态Simon Willison06:50
突破Claude Code Opus 5自动模式
Breaking Claude Code Opus 5 Auto Mode
Claude Code Opus 5的自动模式,开发者需权衡效率与失控风险。
判断
把 auto mode 当作无人值守安全底线的团队,这个默认设置得改:拦截器放行了恶意进程、却拒绝 Claude 自己的清理命令,所以权限边界应从 auto mode 移到容器或 VM 沙箱。
依据
Johann Rehberger 说这条攻击约在 80% 的情况下成立:诱使 Claude Code 下载并解压一个 zip,其中代码执行 import base64 时,会顺带导入并执行同目录下解压出来的 struct.py。Simon Willison 转述的关键细节是 auto mode 失效的方式——分类器放行了恶意进程的创建,却在 Claude 察觉入侵、试图终止该进程时拒绝了清理命令,他称之为「安全机制本身成了故障的一部分」。Willison 由此把结论落在沙箱上:在容器、VM 或操作系统沙箱里跑无人值守 agent,限制网络出口,不向 agent 运行时暴露家目录、SSH 密钥与云凭证。Lobste.rs 上 hyperpape 提出这是 confused environment attack(环境混淆攻击)而非严格意义的提示注入,因为全程没有恶意指令被模型当作任务执行——这影响归因与修补方向,不影响要不要上沙箱。注意 80% 是 Rehberger 的自测说法。
- 下载并解压 zip解压触发
- import base64顺手导入
- 执行 struct.py发现
- Claude 察觉入侵被拒
- auto mode 拒绝清理
没写清 材料没写这 80% 出自多少次试验、哪个 Claude Code 版本与什么环境,也没写 Anthropic 是否已修补或回应。
下一步 可核对的是:Anthropic 是否把终止进程这类清理命令移出 auto mode 的拦截范围,并发布对应的版本说明。