跳到正文

行业动态Simon Willison06:50

破解Claude Code Opus 5的自动模式

Breaking Claude Code Opus 5 Auto Mode

Claude Code Opus 5的自动模式,开发者需权衡效率与失控风险。

判断

自动模式被设为默认后,安全责任从 Anthropic 那侧转到了开发者自己的沙箱配置上:Rehberger 的攻击在 80% 的运行里成功,自动模式还拦下过 Claude 自己发出的清理命令。默认是否继续开着它,是开发者的取舍。

依据

Johann Rehberger 是当下最可信的提示注入(prompt injection,指把恶意指令混进模型会读取的内容里)研究者之一。他声称针对 Claude Code 自动模式里那个负责判定命令危险性、决定放行还是拦下的分类器(classifier)的攻击,有 80% 的运行成功率:先骗 Claude Code 下载并解压一个 zip 压缩包,其中导入 base64 的动作会顺手引入并执行压缩包里名为 struct.py 的本地文件。Simon Willison 转述时点出更麻烦的一层——有几次自动模式不是拦住入侵,而是阻止了 Claude 察觉被入侵后发出的清理命令,也就是这道安全机制自己成了故障的一部分。他的结论是:只要存在被对手盯上的风险,唯一安全的跑法就是把编码代理放进容器、虚拟机或操作系统级沙箱,限制网络出口,且不把家目录、SSH 密钥、云凭据暴露给代理运行时。8月30日 Lobste.rs 上的 hyperpape 补充,这不算典型提示注入,因为全程没有模型误从网页执行恶意指令,更像暴露环境本身导致的 confused environment attack(混淆环境攻击)。

  1. 下载并解压压缩包
    解压后
  2. 导入 base64 引出 struct.py
    触发本地文件
  3. 恶意代码执行
    被察觉
  4. Claude 察觉并要求清理
    拒绝清理
  5. 自动模式拒绝清理命令
压缩包被解压后触发本地文件执行,Claude 察觉却清不掉这条链路。

没写清 Anthropic 是否已修复这次拦停清理命令的问题、是否改动自动模式的默认地位,材料没有交代,所以不能替它断言这道防线现在还有效。

下一步 核对 Anthropic 在 8月30日之后是否发布过针对自动模式拒绝清理命令的修复说明,或调整过默认设置。

本期其他新闻

  1. 行业动态

    如今,仅凭一个关于bug的传闻就足以发现安全漏洞

    Simon Willison

  2. 行业动态

    关于SpaceX收购Cursor后我们做出的决定

    OpenAI

  3. 行业动态

    支持泰国新一代AI初创企业

    OpenAI

  4. 精选深读

    开放ASR排行榜新增首个全球南方语言

    Hugging Face

  5. 精选深读

    Gemini Omni 1.1 Flash让您的构建更具控制力

    Google DeepMind