跳到正文

行业动态Simon Willison06:50

突破性发布:Claude Code Opus 5 自动模式

Breaking Claude Code Opus 5 Auto Mode

Claude Code Opus 5的自动模式,开发者需权衡效率与失控风险。

判断

把 auto mode 设成默认护栏的团队,得重挑默认值:要么改为在容器或 VM 沙箱里跑并限制出网,要么接受这套护栏会在 agent 察觉入侵后,连它自己的清理命令一起拦下。

依据

Simon Willison 引的是 Johann Rehberger —— 后者称这条攻击对 auto mode(Claude Code 自动放行命令的模式)有 80% 的命中率。路径是让 Claude Code 下载并解压一个 zip 归档,再执行一段导入 base64 的代码,而这次导入会顺带执行从归档里解出的本地 struct.py。关键不在绕过:分类器放行了恶意进程的创建,随后 agent 察觉入侵、发出终止命令时,auto mode 又把这条清理命令拒了。Willison 的结论是无人值守时唯一安全跑法是沙箱 —— 容器、虚拟机或操作系统级隔离,限制网络出口,监控 agent,不把家目录、SSH 密钥、云凭证暴露给运行时。8月30日的更新里,Lobste.rs 用户 hyperpape 指出这不算经典提示注入(prompt injection,把恶意指令藏进 agent 会读到的内容里诱导它照做):全程没有网站上的恶意指令被模型跟随,更像环境本身被混淆后遭到利用。

  1. 下载并解压 zip 归档
    解压后导入
  2. 导入 base64 触发本地 struct.py
    执行
  3. 恶意进程开始执行
    察觉
  4. agent 察觉并发终止命令
    命令被拒
  5. auto mode 拒绝清理
从解压 zip 到 auto mode 拒绝清理命令的攻击链。

没写清 材料没给 80% 的样本量和所测版本,也没提 Anthropic 是否复现或回应过这条攻击。

下一步 盯 Anthropic 的 Claude Code 发布说明:auto mode 对清理命令的拦截是否被改掉,沙箱是否变成默认。

本期其他新闻

  1. 行业动态

    试点全球首个双盲 AI 评估

    Google DeepMind

  2. 行业动态

    扩大 OpenAI 在巴西的业务版图

    OpenAI

  3. 精选深读

    Gemini Omni 1.1 Flash 助您更精细地构建应用

    Google DeepMind

  4. 精选深读

    Qwen3.8-Flash-Next

    Simon Willison

  5. 精选深读

    更佳答案,更广思维:学生从 ChatGPT 与批判性思维训练中的收获

    OpenAI