精选深读Simon Willison06:07
Claude Sonnet 5.5
若Sonnet 5.5命名属实,选型时得重新权衡性能与成本。
判断
对拿 claude.ai 免费档做原型的团队,这改的是「要不要为编码任务付费升 Opus 5.5」这个决定:免费档现在跑的就是 Sonnet 5.5,而它在部分编码任务上已接近 Opus 5.5。
依据
Simon Willison 在 2026年9月28日的短文里转述,Anthropic 称 Sonnet 5.5「跑得快 30% 以上,多数工作便宜最多 30%」,定价与 Sonnet 5 相同,却在他看到的每一项基准上胜出。他把「思考强度」(thinking effort,即模型回答前允许自己消耗多少推理 token 的档位)拉到 max 试了一次:Sonnet 5.5 与 Opus 5.5 犯了同一个毛病,想满 128,000 枚 token、花掉 1.28 美元后耗尽额度,仍没画出骑自行车的鹈鹕;换到 xhigh 档,5.74 美分、41 秒就交付了。更关键的动作是 Sonnet 5.5 被放进 claude.ai 的免费档,而 ChatGPT 免费档跑的是 Luna 5.6,两边的免费用户拿到的模型档位不一样。
- max 档思考 token128,000 枚
- max 档失败成本$1.28
- xhigh 档成本5.74 美分
- xhigh 档耗时41 秒
没写清 材料只给了「便宜最多 30%」这种相对说法,没给 Sonnet 5.5 或尚未发布的 Haiku 5.5 的每百万 token 绝对价格,所以省下的钱没法算。
下一步 等 Anthropic 公布 Haiku 5.5 定价,再与 GPT-6 Luna 对照每百万 token 单价。