跳到正文

2026年08月22日AI 版

6 条 · 3 个来源

头版

行业动态Simon Willison

不要再做 TUI
TUI不是默认答案,先想清楚交互场景再动手,别为炫技牺牲可用性。

每天都要看的小工具可以改做图形界面,跑一次就结束的脚本不必为界面付维护成本。

展开全文

依据

Thomas Ptacek认为编码代理已经把原生界面的构建成本压得很低,小型个人工具也值得用图形界面,而不是终端界面。Simon Willison用自己每天在用的macOS任务栏应用做例子,用它看带宽和GPU。频繁交互或持续监控适合这条路;一次性脚本用命令行往往更省事。图形界面仍有维护成本。

没写清 材料没写这个任务栏应用花了多少开发时间,也没写后来的维护量。

下一步 动手前先分清这是每天都要看的监控,还是跑一次就结束的脚本。

行业动态

2

  1. 行业动态Simon Willison

    引用 Matt Webb
    Matt Webb观点引述有启发,但缺乏具体论证,适合扩展思考而非直接采信。

    负责 AI 与学习议题的编辑,该把这条从证据降为引子,并据此影响团队怎么用 AI:让模型当讲解者而不是代写者,代价是工程师得自己花时间提问、验证、再实现。

    展开全文

    依据

    Matt Webb 在 Galactic Compass 2 的更新里写道,1.0 发布后他以为自己得亲手做旋转,于是坐下来跟 ChatGPT 谈,没让它写代码,而是让它当耐心的互动导师;结果他学会了四元数(quaternion,描述三维旋转的数学表示)到刚好让应用跑起来的程度,并说把一部分思考外包给 AI,反而推着他学更多。机制在于可追问的讲解:他能反复问为什么,直到自己写得出那段旋转代码,这跟代码补全是两种用法。同一页上的对照数字来自 Simon Willison 的标签计数——ai 2,247 条、llms 1,958 条、chatgpt 204 条,education 只有 29 条,说明这份语料本身几乎只谈 AI 能力,谈学习的样本极少,所以这条是孤例而不是可外推的统计。取舍也在这里:换成导师模式,换来的是理解,付出的是工程师自己的提问和验证时间,只有在他愿意追问、且能判断答案对错时才成立;若只是接收输出,外包就成了替代。

    • ai 标签2,247
    • llms 标签1,958
    • chatgpt 标签204
    • education 标签29
    Simon Willison 博客的标签计数,对比 AI 相关话题与教育话题的条目数量

    没写清 材料没给学习时长、提问轮次,也没有前后测评或对照组,所以不能替它补上「AI 辅导让人学得更多」这个结论。

    下一步 核对点:Galactic Compass 2 后续版本的说明里,旋转与 AR 相关改动是否仍写着他自己实现,还是又交回了 AI 代写。

  2. 行业动态Google DeepMind

    从 Atari 到 EVE Online:基于 15 年游戏 AI 研究构建
    15年游戏AI研究转向商业合作,能否落地成真价值待市场检验。

    游戏工作室的技术负责人要不要把在研玩法开放给 DeepMind 做原型:换来前沿智能体能力,代价是把玩法节奏和上线时间让给一个按论文节奏推进、且未承诺商业交付的合作方。

    展开全文

    依据

    作者 Alexandre Moufarek 和 Adrian Bolton 把这条线称作「游戏是 AI 研究的引擎」。2015 年那篇 Nature 论文里的 DQN(Deep Q-Network,深度 Q 网络,一种直接从屏幕像素学玩的强化学习方法)在 49 款 Atari 2600 游戏上通关,没有为任何一款做专门工程;2016 年 AlphaGo 击败围棋世界冠军李世石,AlphaGo Zero 靠纯自对弈、不用人类棋谱超过此前所有版本,AlphaZero 又把同一套方法用到国际象棋、将棋和围棋。机制在于:游戏规则封闭,却能源源不断生成带胜负标签的对局,研究者不必等真实世界的数据就能反复迭代。现在改为与 Fenris Creations、EVE Universe、Hello Games 等商业工作室合作做玩法原型,换来的是真实玩家的行为约束和内容排期——这恰是实验室环境里最缺、也最难控的一环,代价是研究议程要和商业项目的时间表绑在一起。

    1. DQN 从像素学玩 Atari
      推向复杂博弈
    2. AlphaGo 击败李世石
      去掉人类数据
    3. AlphaGo Zero 纯自对弈
      泛化到多棋种
    4. AlphaZero 通吃棋类
      转向商业合作
    5. 与工作室合作做原型
    从像素学 Atari 到与工作室合作做原型,这条 15 年研究路线的五个节点。

    没写清 材料只列了合作方名单,没有说原型由谁出资、IP 与代码归谁、玩家什么时候能玩到,所以落地收益不能替它算。

    下一步 核对 Fenris Creations 与 EVE Universe 那条合作有没有交出可玩原型或论文,而不是又添了几家工作室署名。

AI工具

2

  1. AI工具Simon Willison

    ChatGPT 搜索现在大规模使用 site: 运算符
    搜索引入site语法,精准度提升但依赖站点收录范围。

    做 GEO(生成式引擎优化,即面向聊天机器人的 SEO)的团队该把一部分预算从改写内容挪到站点收录与索引覆盖上:当 16–17% 的搜索子查询直接带 site: 时,没被目标引擎收录的页面写得再好也进不了候选池。代价是优化对象从读者变成爬虫的收录范围。

    展开全文

    依据

    Promptwatch 用自动化追踪 ChatGPT、Claude、Gemini 里的提示词回复并公开聚合报告,是 GEO 这个新兴品类的内容营销打法。它记录到 ChatGPT Search 的 fanout(一次提问扩散出的多条子查询)中带 site: 操作符的比例:连续数周停在 0.3%–0.5%,8月3–5日短暂降到 0.15%,8月8日跳到 16–17%,时间与 GPT-5.6 上线、以及 OpenAI 8月6日「让 GPT-5.6 Sol 在事实性上更可靠、回答更聚焦」的模糊公告重合。Simon Willison 说 OpenAI 刻意隐藏 system prompt(系统提示词),他自己试探后判断搜索工具的形状更像 search(query, recency, domains)——把站点限定做成参数,而不是指望模型自己写 site: 语法。若这一判断成立,模型就不必「学会」操作符,域名取舍被挪进工具参数,被列进 domains 的站点才有出场机会;8月18日 Promptwatch 还报告 Reddit 被引用的概率大幅下降,但 Willison 在最全的泄露 system prompt 合集里没找到对应改动,无法证实。这些数字只覆盖他们开了自动追踪的那部分提示词,不是全量。

    • 连续数周0.3%–0.5%
    • 8月3–5日0.15%
    • 8月8日16–17%
    ChatGPT Search 含 site: 操作符的查询占比在 8 月 8 日前后跳升

    没写清 材料没说 domains 参数由谁按什么规则填充——白名单、检索排序还是别的,所以无法判断收录门槛具体卡在哪一步。

    下一步 看 Promptwatch 下一期报告里 site: 占比是否守住 16–17%,以及 Reddit 引用率是否继续下滑。

  2. AI工具Hugging Face

    借助 LFM2.5-DSpark 实现高达 3.2 倍的推理加速
    速度提升3.2倍,但需验证是否以精度或资源为代价。

    部署 LFM2.5-2.6B 做端侧 function-calling 的团队,可以按延迟降 57%、精度不变把 DSpark 默认打开;但 1.2B 必须先按自家文本分布重测,8B-A1B 先别开。

    展开全文

    依据

    LiquidAI 团队在 Hugging Face 发布了 LFM2.5 三个模型的 DSpark 草稿模型 checkpoint:1.2B-Instruct、2.6B、8B-A1B。机制是投机解码(speculative decoding):轻量草稿模型先一次前向吐出候选 token,目标模型再一口气验证全部候选,把权重的 DRAM→SRAM 搬运成本摊到多个 token 上——解码阶段本来就是 memory-bound,瓶颈在搬权重而不在算。三个草稿模型都在 300M 参数上下(295.7M 和 327.7M),显存只多这一点。质量上,贪心解码下草稿 token 必须匹配目标分布才被接受,被拒就换目标模型自己的 token,输出序列与基线逐字相同。速度:2.6B 在 H100 均值 323 → 864 tok/s(2.67x),M4 Max 61 → 139 tok/s(2.27x);1.2B 在 M4 Max 均值 138 → 350 tok/s(2.54x)。代价落在接受率上:块大小是 9,均值只接受 4.81 个,1.2B 因文本分布不同加速比能差 52%;8B-A1B 接受率更高,端侧却只快 18%,材料把原因归给 llama.cpp 的 Metal 后端 MoE 实现。

    • LFM2.5-2.6B · H100323 → 864 tok/s
    • LFM2.5-2.6B · M4 Max61 → 139 tok/s
    • LFM2.5-1.2B · M4 Max138 → 350 tok/s
    • LFM2.5-8B-A1B · 端侧18%
    同一批 DSpark 草稿模型在不同硬件上的吞吐变化

    没写清 材料只测了 batch size 为 1、温度 0、最多 256 输出 token 的场景,没有并发服务下的加速与显存数据。

    下一步 拿自家多轮 function-calling 流量,在 batch size 大于 1 时复测 2.6B 的 57% 延迟降幅是否保持。

精选深读

1

  1. 精选深读Hugging Face

    衡量语音识别中的基准优化
    基准虚高被量化成尺子,选型者得擦亮眼,代价是参考价值打折。

    语音识别选型不能只看榜分:模型会复述基准里的错字,公共基准的参考价值要打折。

    展开全文

    依据

    这项研究用识别错误转写、掩蔽相关词、二义性拼写切换来量基准优化。VoxPopuli里音频明确说了Thank you,参考文本却没写,11个开源模型里有6个复述了错误基准。换到同一说话人的克隆录音或新的议会录音,多数模型的行为反过来了,说明它们在认这是哪条基准,而不是在做转写。

    没写清 材料只覆盖了11个模型和两个数据集,清掉基准痕迹之后还会不会这样,没有结论。

    下一步 上线前用自己的真实录音复核,不要只按公共榜的名次采购。