跳到正文

精选深读Simon Willison06:07

Claude Sonnet 5.5

若Sonnet 5.5命名属实,选型时得重新权衡性能与成本。

判断

对拿 claude.ai 免费档做原型的团队,这改的是「要不要为编码任务付费升 Opus 5.5」这个决定:免费档现在跑的就是 Sonnet 5.5,而它在部分编码任务上已接近 Opus 5.5。

依据

Simon Willison 在 2026年9月28日的短文里转述,Anthropic 称 Sonnet 5.5「跑得快 30% 以上,多数工作便宜最多 30%」,定价与 Sonnet 5 相同,却在他看到的每一项基准上胜出。他把「思考强度」(thinking effort,即模型回答前允许自己消耗多少推理 token 的档位)拉到 max 试了一次:Sonnet 5.5 与 Opus 5.5 犯了同一个毛病,想满 128,000 枚 token、花掉 1.28 美元后耗尽额度,仍没画出骑自行车的鹈鹕;换到 xhigh 档,5.74 美分、41 秒就交付了。更关键的动作是 Sonnet 5.5 被放进 claude.ai 的免费档,而 ChatGPT 免费档跑的是 Luna 5.6,两边的免费用户拿到的模型档位不一样。

  • max 档思考 token128,000 枚
  • max 档失败成本$1.28
  • xhigh 档成本5.74 美分
  • xhigh 档耗时41 秒
同一只骑自行车鹈鹕在 max 档与 xhigh 档下的开销对照

没写清 材料只给了「便宜最多 30%」这种相对说法,没给 Sonnet 5.5 或尚未发布的 Haiku 5.5 的每百万 token 绝对价格,所以省下的钱没法算。

下一步 等 Anthropic 公布 Haiku 5.5 定价,再与 GPT-6 Luna 对照每百万 token 单价。

本期其他新闻

  1. 行业动态

    引用 @joedaroo

    Simon Willison

  2. 行业动态

    OpenAI 的 AI agents 需要迎头赶上

    The Verge AI

  3. 行业动态

    AI 正在为黑客攻击加速,而你当地的医院和银行尚未准备好

    The Verge AI

  4. 行业动态

    我们何时可以说 AI 做出了科学发现?

    MIT Technology Review AI

  5. 行业动态

    佛罗里达州寻求禁止 ChatGPT 表现得像真人

    The Verge AI

  6. AI工具

    使用 SageMaker AI 上的 vLLM-Omni 构建实时语音应用 – 第 1 部分

    AWS Machine Learning Blog

  7. AI工具

    使用 SageMaker AI 上的 vLLM-Omni 生成图像和视频 – 第 2 部分

    AWS Machine Learning Blog

  8. 精选深读

    Grok 4.7 现已在 Amazon Bedrock 上可用

    AWS Machine Learning Blog