跳到正文

2026年08月24日AI 版

5 条 · 3 个来源

头版

行业动态Simon Willison

Anthropic 最好的 AI 模型难以吸引用户,因更便宜的工具蓬勃发展
性价比时代,顶级模型也需价格下探,否则难敌开源与小型模型挤压。

旗舰的定价要在性能和价格之间做取舍,否则开源和小模型会继续挤占企业账单。

展开全文

依据

Fable 5在Ramp AI指数里只占Anthropic模型支出的8.0%,前代Opus 4.8仍占28.0%。指数来自7万家公司的账单。知情人士称7月年化收入65亿美元,5月为47亿美元,并预计Q3盈利。新旗舰的采用率仍然偏低。

没写清 材料没说明8.0%是价格造成的,还是能力或接入方式造成的。

下一步 看下一期指数里,旗舰支出占比有没有超过前代。

行业动态

3

  1. 行业动态Simon Willison

    引用 Drew Breunig
    引用他人观点而非原创内容,价值有限,但可作行业观察参考。

    这次变化改的是工程团队的模型选型与预算分配:不再等下一个模型顺手抹平 harness 和上下文问题,而是按成本把活分派给 Fable 或 Opus、5.6、K3、GLM。

    展开全文

    依据

    Drew Breunig 在 2026年8月23日被 Simon Willison 收录的引语里说,Fable 出现之前,花太多时间改进 coding harness(模型外面那层调用、工具与提示词的封装)和上下文策略显得很蠢,因为新模型会以同样的价格、甚至更便宜地出现,把这些问题盖过去。他强调 Fable 落地后依然 incredible,但成本太高,而 Opus 以及 5.6、K3、甚至 GLM 对大部分代码已经够用,于是他们开始想「哪类活分给谁」。机制是把投入从等待下一代模型,转到工程侧的任务分派:贵的模型只留给它明显更强的那部分工作。这条引语是 Simon Willison 收集的他人发言,不是他本人的测试结论。

    没写清 材料只给了 Fable 成本「太高」这个定性,既没有价格数字,也没说最终哪类活分给了哪个模型。

    下一步 下一步可核对:Breunig 或 Willison 后续是否给出 Fable 的价格数字或具体的任务分派清单。

  2. 行业动态Simon Willison

    引用 Linus Torvalds
    Linus的直言不讳是开源文化一剂清醒剂,但要注意其语境依赖。

    对用 AI 做调试的工程师,这改变的是收手时机:AI 说「做不到」不是结论,而是需要被推回去检验的假设。代价由人来付——这份固执模型给不了,必须由你在它罢工时继续追。

    展开全文

    依据

    Linus Torvalds 在 2026年8月22日 的 drm/xe 提交里称这是一次「地狱级调试会话」(debug session from hell),AI 替他干了大量粗活(grunt-work);但 AI 多次直接声明问题 impossible and unsolvable,建议干脆写份报告。他给的解释是,这些模型被「没他那么固执的人」训练过。机制落在放弃阈值:模型把训练分布里多数人收手的位置当作终点,Torvalds 的固执是分布外的输入,他一推,AI 就继续加调试代码并忠实分析。取舍也在这里:产出依赖人类一侧不肯让步,模型不会自己长出这种固执;他还把提交信息交给 AI 写,等于把信任押在「被推着走之后的产出」上,而不是押在 AI 对可行性的判断上。

    1. AI 做调试粗活
      断言无解
    2. AI 断言无解、要写报告
      被推回
    3. Linus 坚持推进
      继续分析
    4. AI 继续加调试代码
      代写提交
    5. AI 写下提交信息
    从 AI 干粗活、断言无解,到被人推回后继续调试并代写提交信息

    没写清 材料没写那次调试最后是谁定位根因、AI 加的调试代码有多少被留下,因此无法算出 AI 的实际增益。

    下一步 查 2026年8月22日 drm/xe 那条「Don't hand out the flat CCS storage as usable VRAM」提交,核实提交信息是否真由 AI 写成。

  3. 行业动态Google DeepMind

    从 Atari 到 EVE Online:基于 15 年游戏 AI 研究的构建
    15年游戏AI研究转向商业合作,能否落地成真价值待市场检验。

    游戏工作室的技术负责人要在「接 DeepMind 的研究原型」和「自建 AI 团队」之间下注:换来的是一流强化学习能力,代价是把玩法节奏的一部分话语权交给合作方。

    展开全文

    依据

    作者 Alexandre Moufarek 和 Adrian Bolton 给出的依据是一条十五年曲线:DeepMind 2010 年成立后把游戏当理解智能的试验场,DQN(Deep Q-Network,深度 Q 网络,用神经网络从屏幕像素直接学动作价值)在 2015 年发表于 Nature,不做任何游戏专属工程就学会 49 款 Atari 2600 游戏;2016 年 AlphaGo 击败李世石,AlphaGo Zero 则完全靠自我对弈、不用人类棋谱。机制是:游戏规则明确、反馈密集,强化学习(reinforcement learning,即靠试错加奖励信号调整策略)能在低成本环境里反复迭代,再把能力外移。这次的转向是把能力反向输出给制作方——与 Fenris Creations 围绕 EVE Universe 的新研究合作,以及 Hello Games、Coffee Stain Studios 等工作室的项目。取舍在于节奏:DeepMind 按研究周期推进,工作室按发行节点排期,原型一旦迁就不上,付代价的是工作室的档期和人力,而不是论文。

    • DQN 无专属工程学会的 Atari 2600 游戏49 款
    • DQN 论文发表于 Nature2015 年
    • AlphaGo 击败李世石2016 年
    从 49 款 Atari 游戏到 AlphaGo 的三个节点

    没写清 材料没给这些合作的投入规模、分成方式,也没说任何一个原型是否会进入正式发售的游戏版本。

    下一步 核对 Fenris Creations 与 EVE Universe 的合作是否公布首个可玩原型及其上线时间。

精选深读

1

  1. 精选深读Ahead of AI

    Claude 如何为 AI 生成的文本添加水印
    水印虽好用,但删除也容易,检测并非万能。

    Anthropic 给 Claude 文本输出加水印后,要改的是审核方和内容平台的取证流程:不能把检测结果当成作者归属的唯一证据;一旦水印可被改写或删除,就得转为抽样复核,并接受漏判与误判的成本。

    展开全文

    依据

    Sebastian Raschka 在 8月22日发布 48 分钟视频(原本计划 10 页幻灯片、10 分钟,最终超 50 页)解释 Claude 水印:Anthropic 在 8月14日文章只讲为何做、没讲怎么做,他补的是 token sampling(模型逐词元采样)阶段如何被用来嵌入水印,以及检测和删除如何让信号失效。水印检测因此只能提供概率线索,不能单独证明某段文字出自 Claude;审核方若把它当唯一证据,错判成本会落到被指控的作者身上。

    • 原计划幻灯片10 页
    • 最终幻灯片>50 页
    • 原计划时长10 分钟
    • 最终时长48 分钟
    Raschka 的讲解规模:计划 10 页/10 分钟,实际超 50 页/48 分钟。

    没写清 材料没给检测的误报率、漏报率,也没说删除后还剩多少可检测信号。

    下一步 可核对 Raschka 随视频发布的幻灯片是否列出检测阈值,或删除实验的具体结果。