跳到正文

精选深读Simon Willison04:18

GPT-6 Astra

GPT‑6 Astra

GPT-6 Astra命名存疑,官方披露有限,需等实测数据验证是否真升级。

判断

决定采购的团队该把比较口径从「榜单名次」换成「跑分用的那套 harness」:99.9% 的 ARC-AGI 3 只在 OpenAI 自建的 Provider Adapter harness 下成立,默认 harness 只有 62.7%。

依据

Simon Willison 在 9月3日的链接帖里写明自己还没试过 Astra,所以他的判断只到定价那一层:每百万输入 10 美元、输出 50 美元,与 Claude Fable 5 和 5.1 同价。需要拆开看的是把 99.9% 撑起来的那套脚手架。ARC-AGI 博客指出,99.9% 是在 OpenAI 自建的 Provider Adapter harness(一种外挂适配层)下、花 19K 美元取得的,默认 ARC-AGI harness 只拿到 62.7%,成本 26K 美元。两者的差别在于,前者在请求之间保留不透明的推理状态,并用 compaction(长对话压缩)让模型复用先前的工作,分数里因此有一部分来自外部记账,而非模型本身的单次推理。安全类任务同样给出对照:ExploitBench 上 Astra 是 100%,GPT-5.6 Sol 是 78.5%;SRE-Bench 二进制逆向四次内 99.2%,Sol 是 68.7%。但 Artificial Analysis 的 Intelligence Index 上 Astra 是 61,与 GPT-5.6 Sol 持平,比 Claude Fable 5.1(max with fallback)低 5 分。

  • ExploitBench · Astra100%
  • ExploitBench · GPT-5.6 Sol78.5%
  • ARC-AGI 3 · 自建 harness99.9%
  • ARC-AGI 3 · 默认 harness62.7%
同一批任务在两套 harness 下的分数差

没写清 材料里没有 Fable 5 在 ARC-AGI 3 的公开成绩,也没有第三方用默认 harness 复测 Astra,所以两家谁强无法从这组数字直接读出。

下一步 等 ARC-AGI 榜单补上 Fable 5 的结果,或等 Willison 拿到访问权后公布 gpt-6-astra 的实测数据。

本期其他新闻

  1. 行业动态

    一线防御者的黎明:10亿美元保护关键服务

    OpenAI

  2. 行业动态

    Legora在几分钟内用GPT-6 Astra审查了41份文档

    OpenAI

  3. 行业动态

    Playco使用GPT-6 Astra将游戏原型制作中的手动修复减少了50%

    OpenAI

  4. 精选深读

    WeatherNext 3:我们最先进、最准确的全球天气AI模型

    Google DeepMind

  5. 精选深读

    NeoMME:一个高效的多模态原生和多语言编码器

    Hugging Face