行业动态Simon Willison06:20
引用Anthropic Frontier Red Team
Quoting Anthropic Frontier Red Team
Anthropic红队以原话示人,少了包装却难验证,安全声明仍得看后续披露。
判断
把「没看到模型做出二进制利用」当作上线放行门槛的安全评测团队,要把门槛从一次二元通过改成按随机100题报告成功率,并把4%–6%视作需要预设处置的新区间。
依据
Anthropic Frontier Red Team(Anthropic 前沿红队)在 Simon Willison 博客 9月29日 的引文里说,他们从 internal Binary Exploitation benchmark(内部二进制利用基准)随机抽 100 道任务,评测多个模型:GLM-5.3 在 4% 的 trial(单次试验)中做出 full control flow hijack(完整控制流劫持,把程序执行流改到攻击者指定的位置),Claude Mythos Preview 是 6%;而更早的 Claude Opus 4.6 和 GLM-5.2 在同一批任务里一次都没成功。红队把这条线称为「一个明显的阈值被跨过」,机制上等于把安全判断从“这批模型全为零”改成“抽样100题中已出现非零成功”。
- GLM-5.34%
- Claude Mythos Preview6%
没写清 材料没写成功判定标准、随机种子、置信区间和是否可复现,所以不能把这 4% 与 6% 当成跨团队可比的能力率。
下一步 等 Anthropic 公开这 100 题的评分脚本与逐题结果,或第三方用同一基准复现 GLM-5.3 的 4%。