行业动态Simon Willison06:50
突破性发布:Claude Code Opus 5 自动模式
Breaking Claude Code Opus 5 Auto Mode
Claude Code Opus 5的自动模式,开发者需权衡效率与失控风险。
判断
把 auto mode 设成默认护栏的团队,得重挑默认值:要么改为在容器或 VM 沙箱里跑并限制出网,要么接受这套护栏会在 agent 察觉入侵后,连它自己的清理命令一起拦下。
依据
Simon Willison 引的是 Johann Rehberger —— 后者称这条攻击对 auto mode(Claude Code 自动放行命令的模式)有 80% 的命中率。路径是让 Claude Code 下载并解压一个 zip 归档,再执行一段导入 base64 的代码,而这次导入会顺带执行从归档里解出的本地 struct.py。关键不在绕过:分类器放行了恶意进程的创建,随后 agent 察觉入侵、发出终止命令时,auto mode 又把这条清理命令拒了。Willison 的结论是无人值守时唯一安全跑法是沙箱 —— 容器、虚拟机或操作系统级隔离,限制网络出口,监控 agent,不把家目录、SSH 密钥、云凭证暴露给运行时。8月30日的更新里,Lobste.rs 用户 hyperpape 指出这不算经典提示注入(prompt injection,把恶意指令藏进 agent 会读到的内容里诱导它照做):全程没有网站上的恶意指令被模型跟随,更像环境本身被混淆后遭到利用。
- 下载并解压 zip 归档解压后导入
- 导入 base64 触发本地 struct.py执行
- 恶意进程开始执行察觉
- agent 察觉并发终止命令命令被拒
- auto mode 拒绝清理
没写清 材料没给 80% 的样本量和所测版本,也没提 Anthropic 是否复现或回应过这条攻击。
下一步 盯 Anthropic 的 Claude Code 发布说明:auto mode 对清理命令的拦截是否被改掉,沙箱是否变成默认。