跳到正文

2026年08月25日AI 版

5 条 · 3 个来源

头版

行业动态Simon Willison

Anthropic 的最佳 AI 模型难以吸引用户,而更便宜的工具蓬勃发展
性价比时代,顶级模型也需价格下探,否则难敌开源与小型模型挤压。

Anthropic 定价与产品团队若不想让 Opus 5 只拿到 3.5% 的模型支出,就需要把价格下探到企业采购愿意为旗舰档位付的区间;否则预算会留在 Fable 5 的 8.0% 与 Sonnet 5 的 3.6%。

展开全文

依据

Simon Willison 摘录 FT 报道,数字来自「people with knowledge of the matter」(知情人士)。annualized revenue(年化营收,把当期收入折算成全年)方面,Anthropic 七月升至 $65bn,五月为 $47bn;它告诉投资者有 6,000 家客户年支出至少 $100,000。OpenAI 的年化营收在本季度至今跳增 35 per cent,超过 $40bn,七月发布的 GPT 5.6 提振了表现。Ramp AI index(用 70,000 家使用 Ramp 信用卡的公司账单数据估算模型采用率的指数)给出的七月 Anthropic 模型支出占比:Opus 4.8 28.0%,Sonnet 4.6 8.3%,Fable 5 8.0%,Opus 4.6 6.9%,Sonnet 5 3.6%,Opus 5 3.5%。机制是:企业按账单投票,高价旗舰若在支出占比上低于旧款与低价档,收入增长就不能直接证明它被采用。

  • Opus 4.828.0%
  • Fable 58.0%
  • Sonnet 53.6%
  • Opus 53.5%
Ramp 七月 Anthropic 模型支出占比

没写清 材料没有给出各模型单价、合同折扣与企业迁移成本,无法判断 Opus 5 的 3.5% 支出占比有多少来自定价、多少来自发布晚。

下一步 等下一期 Ramp AI index 更新,核对 Opus 5 的支出占比是否超过 Sonnet 5 的 3.6%。

行业动态

1

  1. 行业动态Simon Willison

    引用 Drew Breunig
    引用他人观点而非原创内容,价值有限,但可作行业观察参考。

    对自建编码流水线的团队,选型问题从「等下一代模型来兜底」变成「哪类活路由给哪个模型」;代价是省下的调用费要靠上下文工程和路由逻辑的工时去换,换到的是成本可控,不是能力上限。

    展开全文

    依据

    Drew Breunig 在《Fable & The End of the Free Lunch》里说:Fable 出现前,花时间优化 coding harness(模型之外的脚手架:提示、工具编排、上下文拼装)和 context strategy(上下文策略)显得很傻,因为新一代模型会以同样甚至更低的价钱发布,顺手把这些问题抹平。Fable 落地后确实强,但价格高;而 Opus 以及 5.6、K3、甚至 GLM 对大部分代码已经够用,于是他们开始追问「哪类活该交给哪个模型」。这正是免费午餐结束的机制:模型换代不再同时压价和补短板,工程投入第一次有了正回报,路由从可选优化变成必须维护的资产。Simon Willison 只是转录这段话,没有附自己的测试或价格数据;页面标签计数(llm-pricing 91、claude-mythos-fable 41、drew-breunig 21)只反映话题热度,不构成任何价格对照,所以这条只能当从业者观察读。

    没写清 材料未给出 Fable 与 Opus、5.6、K3、GLM 的实际单价和调用量,也没有 Breunig 团队的分流比例,因此省下多少钱、路由本身要花多少维护成本,都无法核算。

    下一步 查 Fable 与 Opus 的官方每百万 token 报价表,确认 Breunig 说的「贵」是贵几倍,再决定这条是否还成立。

AI工具

1

  1. AI工具Simon Willison

    你的可执行文件是一个 SQLite 数据库
    可执行文件兼作数据库,省去解析开销,适合紧凑分发。

    做单文件分发的打包者要改的决定:把「运行时怎么读数据」从应用层解析挪到内核执行层——代价是安装时必须先往 binfmt_misc 注册,否则这个文件对内核只是一张普通数据库。

    展开全文

    依据

    Simon Willison 引述 Farid Zakaria 的 Linux 做法:把 SQLite 文件格式 68 字节处的 4 字节 application ID(应用标识,告诉 SQLite 这个文件归哪个程序)设成 SELF,即 Structured Executable & Linkable Format;再把 ELF(Linux 可执行文件格式)的各组成部分分别放进若干 SQLite 表,用给出的 schema 描述;由 self-exec 解释器(C 代码)取出并执行。另外用 binfmt_misc(内核里把特定二进制模式绑定到指定解释器的机制)注册一次,内核之后遇到该模式就直接执行。取舍很清楚:省掉运行时解析数据库的开销、拿到单文件紧凑分发,换来的是执行多依赖宿主内核的一次注册;没有 NixOS 时,Simon 给的路径是 printf 写入 /proc/sys/fs/binfmt_misc/register,也就是装机步骤由系统管理员而不是应用自己承担。

    1. SQLite 文件设 SELF
      写入表
    2. ELF 组件拆入表
      注册模式
    3. binfmt_misc 注册
      内核触发
    4. self-exec 提取执行
    从 SQLite 文件到内核执行的四个环节

    没写清 材料没给出这条路径与「解压后再执行」相比的体积或启动耗时数字,所以省下的开销具体是多少无法量化。

    下一步 在一台未注册 binfmt_misc 的普通 Linux 上直接执行那个文件,记录内核返回的是 ENOEXEC 还是被送进 self-exec 解释器。

精选深读

2

  1. 精选深读OpenAI

    通过 Kiro 中的 GPT-5.6 提升开发者的性价比
    本地编译速度虽快,跨平台支持仍是短板,适合单一目标平台项目。

    这条改变的是用 Kiro 的团队选默认模型那一步:单平台项目可以把 GPT‑5.6 当成本优先项,但默认模型一锁,将来要多平台就得自己付迁移代价。

    展开全文

    依据

    OpenAI 把 GPT‑5.6 放上 Kiro,官方口径是面向开发者、覆盖规划到测试四个环节,卖点写成「价格与性能的平衡」,而非某项功能突破。机制上,这类性价比提升来自单位成本下的能力配比变化,收益只落在按量计费或按席位续费的预算表上,对已经固定模型栈、换模型要重做验证的团队并不等价。材料同时点出跨平台支持仍是短板:当项目要落到第二个平台,Kiro 侧的限制会先于模型能力成为瓶颈。取舍因此很直白——把单次交付成本压到最低,就接受单平台锁定;要多平台,就在兼容性验证和改造上多付一笔,这笔账该由提出多平台需求的那一方先算。

    没写清 材料没有给 GPT‑5.6 与前代或其他模型的具体价格、性能数字,也没有迁移或兼容改造的工时估算。

    下一步 下一步可核对:Kiro 或 OpenAI 是否公布 GPT‑5.6 的计价表,以及跨平台支持的明确时间表。

  2. 精选深读Ahead of AI

    Claude 如何为 AI 生成的文本添加水印
    水印虽好用,但删除也容易,检测并非万能。

    内容审核与取证方与其把 Claude 水印当作出处凭证,不如先定下文本长度和阈值门槛:单段文本命中只能当旁证,未命中也不能反推「不是它生成的」。

    展开全文

    依据

    Sebastian Raschka 在 8月22日的视频里,把 Anthropic 的文本水印拆到令牌采样(token sampling,即模型每一步从候选词中挑下一个词的环节)这一层:水印不是事后打标,而是在采样时按密钥偏置候选词,所以任何改写、翻译、重打都会稀释信号。他原计划 10 张幻灯片、10 分钟讲完,实际做到 52 张、48 分钟,多出来的部分正是「水印如何失败、如何被移除」。Anthropic 8月14日的官方文章只讲动机、没有一张图,检测与移除的可操作细节因此由第三方补上,也就等于把移除路径和嵌入路径一起公开了。取舍在这里:要压低误报,就得要求更长的未改写原文,可用的检测场景随之收窄。

    • 原计划幻灯片10 张
    • 实际幻灯片52 张
    • 原计划时长10 分钟
    • 实际时长48 分钟
    计划 10 张幻灯片、10 分钟,实际 52 张、48 分钟

    没写清 材料没说检测在多少词以上才可靠,也没给误报率和漏报率,所以不能断言某段文字一定出自 Claude。

    下一步 可核对的下一步:等 Anthropic 公布检测接口的阈值与误报率,或对同一段被改写文本做一次公开复测。