跳到正文

行业动态Simon Willison06:20

引用Anthropic Frontier Red Team

Quoting Anthropic Frontier Red Team

Anthropic红队以原话示人,少了包装却难验证,安全声明仍得看后续披露。

判断

把「没看到模型做出二进制利用」当作上线放行门槛的安全评测团队,要把门槛从一次二元通过改成按随机100题报告成功率,并把4%–6%视作需要预设处置的新区间。

依据

Anthropic Frontier Red Team(Anthropic 前沿红队)在 Simon Willison 博客 9月29日 的引文里说,他们从 internal Binary Exploitation benchmark(内部二进制利用基准)随机抽 100 道任务,评测多个模型:GLM-5.3 在 4% 的 trial(单次试验)中做出 full control flow hijack(完整控制流劫持,把程序执行流改到攻击者指定的位置),Claude Mythos Preview 是 6%;而更早的 Claude Opus 4.6 和 GLM-5.2 在同一批任务里一次都没成功。红队把这条线称为「一个明显的阈值被跨过」,机制上等于把安全判断从“这批模型全为零”改成“抽样100题中已出现非零成功”。

  • GLM-5.34%
  • Claude Mythos Preview6%
内部二进制利用基准随机100题中两模型出现完整控制流劫持的 trial 比例

没写清 材料没写成功判定标准、随机种子、置信区间和是否可复现,所以不能把这 4% 与 6% 当成跨团队可比的能力率。

下一步 等 Anthropic 公开这 100 题的评分脚本与逐题结果,或第三方用同一基准复现 GLM-5.3 的 4%。

本期其他新闻

  1. 行业动态

    特朗普下令美国政府将AI称为“超级智能”

    The Verge AI

  2. 行业动态

    针对OpenAI的抗议越来越有创意

    Ars Technica AI

  3. 行业动态

    OpenAI因Hugging Face黑客攻击被起诉

    Wired AI

  4. AI工具

    OpenAI的Dots是始终在线的AI Agent——也是其对Meta Muse的回应

    Wired AI

  5. AI工具

    Amazon Quick提示工程基础

    AWS Machine Learning Blog

  6. AI工具

    按Quick组件进行提示工程:模式与陷阱

    AWS Machine Learning Blog

  7. 精选深读

    借助Amazon Bedrock上的GPT-6.1 Sol,将接近Astra的智能带入日常工作

    AWS Machine Learning Blog

  8. 精选深读

    OpenAI推出Dots,对标Muse

    The Verge AI