跳到正文

2026年08月23日AI 版

6 条 · 4 个来源

头版

行业动态Simon Willison

引用林纳斯·托瓦兹
Linus的直言不讳是开源文化一剂清醒剂,但要注意其语境依赖。

把 AI 当结对调试搭档、而不是当可行性裁判的工程师,要改的是听到「做不到」之后的下一步:Linus 的应对是继续压它加调试代码并分析,而不是接受写报告的建议。

展开全文

依据

Linus Torvalds 在 drm/xe 的提交「Don't hand out the flat CCS storage as usable VRAM」下写道:这是一场 a debug session from hell(地狱级调试),AI 承担了大部分苦活;但 AI 几次断言这不可能、无法解决,建议干脆写份报告,他猜训练 AI 的人没他这么固执;当他推的时候,AI 仍照旧加调试代码并忠实分析,最后那段 commit message 是 AI 写的。机制在这里:AI 的放弃姿态来自训练中的人类偏好,用户改不了它,只能改自己给不给推力;推力是否奏效,取决于用户能否判断哪一步还没试过。Simon Willison 站点的标签计数是 ai 2,247、generative-ai 1,992、llms 1,958、ai-assisted-programming 407、linux 54,AI 相关标签量级远超 linux,说明「AI 说做不到」已经不限于内核开发者。

  1. Linus 提交内核 bug
    遇阻
  2. AI 断言不可能、劝写报告
    不认
  3. Linus 继续压
    加代码
  4. AI 加调试代码并分析
    定稿
  5. AI 写 commit message
Linus 这场调试中 AI 从劝退到被推着干活的顺序

没写清 材料没写 Linus 一共推了几次、每次推之后 AI 的判断如何变化,也没有第二个人在同一问题上复现这场调试,所以不能替它补上「换个人继续推也管用」。

下一步 去翻 drm/xe 那笔提交的 commit message 原文,看 AI 写的版本与最终合并版本差了多少行。

行业动态

3

  1. 行业动态Simon Willison

    不仅仅是代码审查
    代码审查的真正价值远超挑错,而是促成认知对齐与设计共识的组织杠杆。

    给团队定 coding agent(编码代理)准入规则的人,该把门槛从「每行都看过」改成「改动人能说清意图、并能独立验证结果」:审查的对象是意图与结果是否对齐,不是行数。

    展开全文

    依据

    Simon Willison 在 2026年8月22日的笔记里写:用好 coding agent 的关键技能,是能自信地告诉它怎么改,再自信地验证改动确实按正确方式落地。他随即给出机制层面的判断——用眼睛逐行扫(原文 eyeballing every line)从来不是验证一次软件变更最有效的办法,逐行读只是达成「确认改对了」的其中一条路径,而不是唯一路径。同一页的 Sponsor 位由 Teleport 提供,其材料自称让 13 位工程师用 LLM 对代码库做了 90 天的「压力清洗」,结论是找安全漏洞上质量优先于数量——这正是一个不靠逐行人眼、而靠其他验证手段站住的例子。落到组织上:当验证方式可以共享,审查就从个人挑错的关口,变成设计意图与验收标准的对齐动作。

    没写清 Willison 只说不必逐行,没写替代手段具体是哪几种,也没有团队规模或返工率数据,所以算不出这套做法省下多少人力。

    下一步 看他下一篇关于 code review 的笔记里,是否出现一个不逐行阅读、却仍给出验证结论的完整实例。

  2. 行业动态Simon Willison

    别再制作TUI了
    TUI不是默认答案,先想清楚交互场景再动手,别为炫技牺牲可用性。

    个人工具开发者挑界面形态时的默认值要改:先分清这个工具是被人一天跑几十次、看完输出就走,还是被反复开着盯状态。后者直接从 CLI 换成原生界面,前者留在终端反而更省事。

    展开全文

    依据

    Thomas Ptacek 主张:哪怕最小的个人工具也该做真正的原生界面(native UI,用系统自带控件搭出的窗口或菜单栏程序),而不是在终端里用字符画框的 TUI,即终端用户界面。他的依据是 coding agent(能自行读写代码、跑命令的编码智能体)已经把「够用的 GUI」的启动成本压到接近零。Simon Willison 拿自己做对照:三月 vibe-coded 的两个 macOS 任务栏 App(带宽监控、GPU 监控)到现在还是每天在用,但他说其他项目仍习惯性写 CLI,「快没借口了」。Thomas 的原话是把「500 个一次性 CLI 里的一个」变成原生 app,不去试就是亏待自己。

    没写清 材料只给了主张和一个 500 的口头数字,没有任何界面形态的实际工时或后续维护成本对照,所以「多大规模的工具才值得换界面」这条线缺数据,补不了。

    下一步 去 Thomas Ptacek 的原帖核对:他有没有给出把某个 CLI 改成原生 app 的实例和耗时。

  3. 行业动态Google DeepMind

    从雅达利到EVE Online:在15年游戏AI研究基础上构建
    15年游戏AI研究转向商业合作,能否落地成真价值待市场检验。

    这条公告把游戏工作室研发负责人的取舍摆上桌面:把下一个玩法原型交给 DeepMind 团队换取研究能力,还是留在自研路线。代价由工作室先付——让出未发布内容与数据控制权,而换回的成果没有公开评测可供对照。

    展开全文

    依据

    Alexandre Moufarek 与 Adrian Bolton 在 2026年8月21日 的 Google DeepMind 博客里宣布,已与 Fenris Creations 及 EVE Universe 建立新的研究合作,此前也与 Hello Games、Coffee Stain Studios、Foulball Hangover 等工作室共事。他们给出的历史刻度是可核对的:2015 年《Nature》上的 DQN(Deep Q-Network,深度 Q 网络)在没有任何游戏专属工程的情况下学会 49 款 Atari 2600 游戏,2016 年 AlphaGo 击败李世石,AlphaGo Zero 完全靠自我对弈、不用人类数据。旧模式的取舍很干净——研究方拿走可公开复现的指标,工作室只提供环境。新合作把交付物从论文换成玩法原型,评价标准从胜率变成留存与手感,而留存数据在工作室手里、模型能力上限在 DeepMind 手里,任何一方都无法单独判定成败,这就是为什么先开放内容、先投入排期的那一方承担更大的沉没成本。

    • DQN 无专属工程学会的 Atari 2600 游戏49 款
    • DeepMind 游戏 AI 研究跨度15 年
    • AlphaGo 击败李世石2016 年
    DQN 与 AlphaGo 的公开里程碑,对照 15 年研究跨度

    没写清 材料没说合作的资金投入、知识产权归属与分成方式,也没说原型若验证成功由谁决定是否推入正式产品。

    下一步 可核对的下一步是 Fenris Creations 与 EVE Universe 的合作成果首次公开时的形态:论文、可玩原型,还是直接进入产品功能。

精选深读

2

  1. 精选深读Ahead of AI

    Claude如何为AI生成的文本添加水印
    水印虽好用,但删除也容易,检测并非万能。

    若你打算拿 Claude 水印当版权追责或学术诚信的硬证据,Raschka 的 48 分钟拆解会逼你改决定:它只能增加筛查信号,不能保证检测成功;检测方还要为移除与改写造成的漏检付代价。

    展开全文

    依据

    Sebastian Raschka 在 Ahead of AI 中说,Anthropic 8月14日的 Claude 文本水印(把可检测信号嵌进生成文本)说明“没有一张图”,于是他把原计划 10 页、10 分钟的讲解做成 52 页、48 分钟的录播,专门拆 token sampling(模型按概率从候选词里抽下一个词)、水印检测与移除。机制上,水印不是可见标签,而是把可检测信号嵌进采样选择;检测需要按同样规则做统计判断。材料给出的对照是原计划 10 页、10 分钟,最后超过 50 页、48 分钟,说明解释该机制的成本高,也说明 Anthropic 文档偏概念、缺操作步骤。

    • 原计划幻灯片10 页
    • 最终幻灯片>50 页
    • 原计划时长10 分钟
    • 最终时长48 分钟
    Raschka 把原计划 10 页、10 分钟的讲解扩成超过 50 页、48 分钟。

    没写清 材料没有给出水印检测的准确率、误报率,也没有说明第三方如何拿到密钥或调用检测接口。

    下一步 下一步核对 Anthropic 后续文档是否公开 Claude 水印检测接口、密钥申请条件和准确率/误报率数字。

  2. 精选深读Hugging Face

    衡量语音识别中的基准优化
    基准虚高被量化成尺子,选型者得擦亮眼,代价是参考价值打折。

    语音选型的人该把 ASR 榜单分数从采购依据降成初筛门槛:让候选模型在自己录的干净音频上复跑一遍再签。因为音频里只要带上基准的那点声学痕迹,分数就会替模型说出它没听到的话。

    展开全文

    依据

    Hugging Face 与 HumeAI 的 Theo Lebryk 等人在 8月21日发文,用三个测试量化语音识别里的基准优化(benchmark optimization,指模型记住测试集而非学会任务的提分方式)。共识分歧探针(consensus disagreement probe)让一组按音素错误率 PER(phoneme error rate,转写与音频发音的吻合度)挑出的独立模型做集成,凡是集成一致否定基准参考转写的片段就送人工标注。一段 VoxPopuli 音频里说得出 “Thank you, Mr. President”,参考转写却漏掉 “Thank you”,11 款模型中有 Six of the 11 照抄了这条错误转写,连漏掉该短语的模型也一并复制基准把 Mr 写成不加句点的标点风格。换成新录的议会克隆音或通用音色后,多数模型又改回照音频转写,说明它们响应的是「这是哪套基准」的声学线索。VoxPopuli 参考转写本身错误多,Artificial Analysis 才出过清洗版。

    • 受测开源 ASR 模型11 款
    • 复现基准错误转写的模型Six of the 11
    受测模型规模与照抄基准错误转写的比例

    没写清 材料没给出这 11 款模型在抹掉基准声学线索后的重排名,也没说复现错误转写的那些系统分数会掉多少。

    下一步 在 Hugging Face 的 Open-ASR Leaderboard 上核对该文所说的 held-out 集是否已挂出这 11 款模型的复测分数,看谁掉出前段。