跳到正文

2026年08月13日AI 版

6 条 · 4 个来源

头版

行业动态Simon Willison

引用 Florian Herrengt
引用虽短,却直指AI行业信息过载,取舍成关键。

工程负责人应把“团队里至少有一人能解释数据从哪来”设为继续让 AI 修 bug 的门槛;无人能答时先停,否则第四次修复只是把理解债推给下一次故障。

展开全文

依据

Simon Willison 在 2026年8月12日 收集了 Florian Herrengt 的一段引文。Herrengt 写的是:同一个奇怪 bug 第四次尝试修复,这次让 AI 来修;问原开发者数据来源,对方说“其实我不知道,让我问 Claude”;两人并排看屏幕无尽文本,无法判断真假,但 Claude 显得非常自信。机制在于,AI 生成的代码层和服务越多,数据血缘(data lineage,即数据从哪来、经过哪些服务)越难追;调试就从定位缺陷变成向模型求证,而模型置信度不等于可验证性。材料里的标签计数形成对照:ai 2,247、generative-ai(生成式 AI)1,992、llms(大型语言模型)1,958,说明泛 AI 讨论量级很大;ai-assisted-programming 407、ai-misuse 64、cognitive-debt 12 则把切口收窄——尤其 cognitive debt(认知债务,即团队因外包理解而欠下的知识亏空)只有 12 条。取舍是:AI 能省下局部修复时间,代价是系统知识被移出团队;当没人能从头理解整条链路,省下的时间会在下一次故障里连本带利还回去。

  • ai2,247
  • generative-ai1,992
  • llms1,958
  • cognitive-debt12
同一页面的标签计数:泛 AI 讨论远多于认知债务。

没写清 材料没有给出项目规模、团队人数、服务层数,也没有说明 Fable 或 Claude 的具体版本与失败根因,所以不能替它补出“AI 本可修好”或“必须重写”的结论。

下一步 下一步可核对 Simon Willison 页面或 Herrengt 原文是否补充该 bug 的复现路径、数据来源链,以及第四次修复的最终结果。

行业动态

1

  1. 行业动态Interconnects

    我写了一本AI教科书——还要多久AI能写得更好?
    作者亲测AI写作,逼近人类,但教科书重事实核查,AI易出错。

    给依赖大模型写长篇技术教材的团队一个硬决定:把模型从“章节作者”降为“校对与编辑助手”,章节骨架、因果排序和概念压缩仍由人类作者定稿。

    展开全文

    依据

    Nathan Lambert 在 Interconnects 说他刚写完一本 post-training(后训练)教材,并让大模型帮忙处理 LaTeX(排版系统)公式、做大量 copyediting(文稿编辑)和生成 TikZ/Python 图表。他的判断是:模型在长篇幅非虚构写作上停滞;GPT 4.5、Kimi K2 这类写作口碑好的模型偏旧,而同期模型在 coding(编程)和数学上已从可用走到超人类。机制上,他把组织知识看作 compression(压缩),认为当前 LLM(大语言模型)增加长文熵值,无法靠自身叠出洞见;因此依赖模型自主解决开放科学问题,会先卡在“把成熟科学讲清楚”这一步。材料里的对照是:他把 200-300 页的近终稿 PDF 交给 GPT 5.5 Pro,后者找出深层小错;Claude 则更像有品味的编辑,能理解任务心理模型并给建议。二者说明模型擅长微观查错与建议,不擅长章节级组织。

    没写清 材料没有给出同一章节由人类与模型分别写作后的盲评或错误率对照,所以无法量化“逼近人类”到底差多少。

    下一步 等该书出版后,核对勘误表是否列出 GPT 5.5 Pro 在 200-300 页终稿里标记过的深层小错,以及这些错误是否在终稿被改掉。

AI工具

1

  1. AI工具Hugging Face

    推出 OlmoEarth embeddings:从 OlmoEarth Studio 导出定制嵌入以供下游分析
    定制嵌入导出让分析更灵活,但依赖平台生态,迁移成本需评估。

    做地表分类或变化检测的团队负责人,现在要决定第一版管线的嵌入从哪来:在 OlmoEarth Studio 里按自己的兴趣区和时间跨度算完再导出,还是直接拉公开权重自己跑。选前者省工程,选后者省迁移风险。

    展开全文

    依据

    AI2 的 Kyle Wiggers 在 Hugging Face 上宣布:OlmoEarth Studio 现在可以计算并导出嵌入向量,嵌入向量是地球观测数据的紧凑数值表示,地表特征相近的地方向量相近。流程是先配模型、跑完再下载,参数包括:兴趣区画或传任意多边形;时间跨度 1–12 个月度周期;编码器三档 Nano(128 维、1.4M 参数)、Tiny(192 维、6.2M 参数)、Base(768 维、89M 参数);分辨率 10、20、40、80 米每像素;影像源 Sentinel-2 L2A、Sentinel-1 RTC 或两者。产出是 Cloud-Optimized GeoTIFF(COG,云优化 GeoTIFF),每个嵌入维度一个波段,存为 int8(8 位有符号整数),取值 -127 到 +127,-128 留给 nodata。材料里的对照数字:全局结构那张图用了 1.1M 个季节性 Sentinel-2 样本、聚成 15 个 k-means 簇;越南 Ca Mau 红树林只标 60 个像素(红树林、水、其他三类各 20 个),训一个逻辑回归就铺满全区;农业窗口查询里最相似的斑块余弦相似度 0.89 以上,最不相似的机场裸地、水库旱地和旱生牧场接近零。性能不够时还可以走 SFT(supervised fine-tuning,监督微调)。

    • Nano 编码器维度128 维
    • Tiny 编码器维度192 维
    • Base 编码器维度768 维
    • Ca Mau 标注像素60 个像素
    三档编码器的嵌入维度,以及 Ca Mau 少样本分割所用的标注像素量。

    没写清 Studio 导出的嵌入与用公开权重自行计算的嵌入是否逐位一致、切换时要不要重跑,材料没有给出。

    下一步 核对 olmoearth_pretrain 里的 dequantize_embeddings 能否把你导出的 int8 COG 还原成论文中那套浮点向量。

精选深读

3

  1. 精选深读Simon Willison

    DeepSeek V4 Pro 0813(在 OpenRouter 上)
    官方更新,推理速度提升明显,但未见评测,需要自行验证。

    打算把 DeepSeek V4 Pro 0813 接进生产链路的团队,现在只能按「权重可拿到、评测无从核对」来排期,别把它写进需要对外承诺性能的选型对比表。

    展开全文

    依据

    Simon Willison 说,这个最新的 DeepSeek Pro 模型只走 API,他只能链去 OpenRouter,因为 DeepSeek 没有明显的发布页;他也无法确认是否会放出 open weights(开放权重,即可下载的模型参数文件),但四月 deepseek-ai/DeepSeek-V4-Pro 和七月 DeepSeek-V4-Flash-0731 的权重都放出了,所以他判断很可能。他随后更新:权重已上 Hugging Face,1.7T parameters、893 GB。评测这条链更绕:据他能查到的,benchmark 先发在官方 DeepSeek 微信群,被复制成 Reddit 帖子后遭版主以 low-effort 删除,再被复制成 Hacker News 上的 ASCII 表格。他还用同一个 pelican-riding-a-bicycle 提示词跑低、中、高三档推理,三张鹈鹕图差异很大,他说没在其他模型上见过这种差异。

    • 参数规模1.7T
    • 权重体积893 GB
    已放出的权重规格:参数规模与文件体积。

    没写清 材料里没有一个可核对的 benchmark 数值,也没写这些数字是谁在什么条件下测的,所以它比谁快、快多少,不能替它补。

    下一步 去 Hugging Face 的权重页找官方评测表;若没有,就用同一提示词自己跑低、中、高三档对比出图差异。

  2. 精选深读Google DeepMind

    将手语AI交到用户手中
    手语转文字模型落地,聋人用户受益,但实用场景仍依赖数据覆盖。

    Pixel 11 上的聋人用户可以不打字、直接打手语搜索和发消息;但 Gboard 团队下一批语言排期,取决于 ASL 之外的手语有没有可训练数据,而不是模型本身好不好。

    展开全文

    依据

    Google DeepMind 手语团队 8月12日发布 SL2T(sign-language-to-text,手语转文字)模型,称这是同类模型第一次进入消费产品:Pixel 11 上的 Gboard 和 Live Transcribe 先行支持 ASL(美国手语)转英文。机制和听人用语音听写代替打字一样,只是输入换成手语——搜网页、起草消息、让 Gemini 执行任务都能用,Live Transcribe 里则可以直接打手语回话。材料给出的盘子是:全球有 200 多种手语、估计 70 million 聋人与听障使用者,首发只覆盖 ASL。这决定了排期表上的下一步不是再调模型,而是为下一种手语凑齐标注数据,付费方是 Google 的产品团队。

    • 全球手语种类more than 200
    • 聋人与听障使用者70 million
    首发只覆盖 ASL,背后是 200 多种手语和 70 million 使用者的规模。

    没写清 材料没给 ASL 之外的识别准确率,也没说手语被认错时用户如何修改,测试者反馈只覆盖 ASL 打字场景。

    下一步 等 Gboard 与 Live Transcribe 的 ASL 转文字在 Pixel 11 推送后,看 DeepMind 是否公布下一批支持的手语和设备名单。

  3. 精选深读Hugging Face

    LFM2.5-VL-3B:为边缘端提供更好、更快的视觉能力
    3B视觉模型抢边缘市场,但实测精度与端侧算力平衡待验证。

    选端侧视觉方案的团队,在 3B 档位该把 ScreenSpot-v2 这类屏幕理解与定位指标列为硬门槛,而不是只比总体平均分。

    展开全文

    依据

    LiquidAI 的 Samuel Stevens 等在 Hugging Face 发布 LFM2.5-VL-3B:它用 SigLIP2 400M NaFlex 视觉编码器,搭配与 LFM2.5-2.6B 文本模型相同的预训练主干,预训练约 34T tokens,视觉数据是之前的 4 倍,词表以就地扩展方式翻倍到 128K。机制在于它直接作答、不走推理链,所以实时和端上应用里响应更快。对着数字看:总体平均分 69.4,高于上一代 LFM2-VL-3B 的 57.2,与 InternVL 3.5 4B 的 69.4 持平,仍低于 Qwen3.5-4B 的 70.1;拉开差距的是 ScreenSpot-v2 Desktop 从 6.0 升到 78.7、RefCOCO-avg 从 57.1 升到 87.9。也就是说,赢面集中在屏幕理解和指代定位,不是全项领先。

    • 总体平均分 LFM2.5-VL-3B69.4
    • 总体平均分 上一代 LFM2-VL-3B57.2
    • 总体平均分 Qwen3.5-4B70.1
    • ScreenSpot-v2 桌面 上一代6.0
    3.1B 模型与同档及更大模型的总体平均分对照,外加屏幕理解一项的代际落差

    没写清 材料在「Inference speed on CPU and GPU」一节被截断,没有显存占用、延迟或吞吐数字,端侧算力与精度的平衡无法核对。

    下一步 等 Hugging Face 页面补全推理速度章节后,核对 CPU 与 GPU 上的实测延迟或吞吐数字。