跳到正文

2026年10月05日AI 版

5 条 · 4 个来源

头版

行业动态Simon Willison

九月仅限赞助者简报
仅赞助者能读,非订阅同事这次拿不到,取舍在筛选门槛。

跟进 LLM 动态的人这次要决定的是:是否为提前一个月拿到内容付 $10/month。非订阅同事本期拿不到,等免费版就等于接受同一批材料晚到。

展开全文

依据

Simon Willison 在他的博客上说,赞助者专属月报(sponsors-only newsletter,只发给付费赞助者的月度邮件)本期已经发出,付了钱的人可以立刻读,其他人要等免费版,比赞助者晚一个月。他列出的本期条目里有定价战、3D 图形与像素画、模型进入数学领域等,并放出上一期作为免费预览。机制是把筛选放在付款这一步:$10/month 买到的是提前量,材料最终仍会以免费版出现,所以掏钱的人为「早一个月知道」付费,不掏的人接受同样的内容迟到。他没有写赞助者有多少人,也没写免费版具体推迟几天,更没说这层门槛到底筛掉了谁。

没写清 材料没写免费版到底哪天放出,也没写赞助者人数与入门的判断标准,所以没法算出这道门槛实际拦下了多少人。

下一步 核对下一期免费版是否真的在一个月内出现,并比对内容是否与赞助版一致。

行业动态

4 条

  1. 特朗普疯狂的AI品牌重塑是对科技高管的忠诚测试——而且奏效了

    行业动态Wired AI

    特朗普疯狂的AI品牌重塑是对科技高管的忠诚测试——而且奏效了
    特朗普叫停AI术语,科技高管默许,暴露产业游说代价

    它要改的是科技公司政策与传播负责人的动作:在把产品名、论文和对外口径里的 AI 改成 SI 之前,先拿到白宫行政令的正式文本,并确认同行是否集体跟进——午餐上的默许,已经把拒绝的成本单独压给下一个开口的人。

    展开全文

    依据

    Jacob Weisberg(《Profiles in Cowardice: A Study of Collaboration in the Trump Era》作者)把这顿白宫午餐称为一次特朗普式忠诚测试:通过测试的人,骨气测试就不及格。他的机制解释是「唯一能抵抗这种事的方式是集体行动」;如果贝索斯、黄仁勋、Dario Amodei、扎克伯格、皮查伊、Greg Brockman、Alex Karp 和马斯克当时说「接受自我监管条款,但不接受改名」,特朗普未必能怎样。现实是无人当场反对,于是特朗普在会后记者提到 AI agents 时纠正对方,称改名由「最伟大、最聪明的人」批准。术语上,John McCarthy 七十年前提出 artificial intelligence(人工智能,AI),Google Scholar 搜该词约 7,420,000 条结果;特朗普 9月23日在联合国先暗示,随后在白宫午餐签行政令,政府改称 Super Intelligence(超级智能,SI)。Nick Bostrom 指出 superintelligence 专指远超所有人脑的系统,AI 覆盖范围更广。

    没写清 材料没说 Google、Microsoft、Anthropic、Meta、Amazon、OpenAI、xAI 是否真会改产品名、论文或公司名,也没给行政令原文;因此不能替它们补上实际执行动作。

    下一步 下一步可核对:上述七家公司是否公开回复 Wired,并说明 AI 字样在产品名、论文和对外沟通中是否修改。

  2. 由内而外的AI:在幕后和宾客体验中重建Airbnb

    行业动态Latent Space

    由内而外的AI:在幕后和宾客体验中重建Airbnb
    阿里·达赫转战Airbnb,元老带队重造产品流程,代价是组织磨合。

    阿里·达赫把这刀落在产品、设计、工程三队的交接上:不再先写需求文档再进 Figma,同一批人对着原型直接写代码。想对标 Airbnb 的传统软件公司,先要决定敢不敢删掉这道工序,而不是先选模型。

    展开全文

    依据

    Airbnb CTO 阿里·达赫对 Latent Space 说,这轮改造的目标是推动人换一种工作方式,并把系统落到生产里去。机制是把过去产品需求、Figma 设计、工程实现、生产测试之间的跨团队交接压掉,让三支队伍直接对着原型工作;副产品是代码本身成为被推理的成品,而不是需求文档那类交付物。他给的数字是:60% 的代码已由 AI 撰写,同比上线功能数增加近 80%,普通工程师的 pull request(拉取请求,代码合并前的评审单元)吞吐约 1.6 倍。对外那一侧,约一半客服工单由 AI 直接结掉,公司 Q2 财报口径是近 45%;他解释做法是先建模型和代理,用合成数据跑一批测试再进生产,安全类问题仍留给人工。支撑这些的是内部上下文图谱 Everest,用大模型、向量嵌入和 AI 检索建图并查询:先做的生鲜配送花了八到九个月,后做的机场接送借它的经验只花约六周,通才因此能改原本属于专才的代码段。

    • AI 撰写的代码60%
    • 平均工程师 PR 吞吐1.6x
    • 同比上线功能近 80%
    • 客服工单由 AI 解决近 45%
    Airbnb 自报的四项改造指标

    没写清 材料没给 AI 撰写那 60% 代码的返工率与评审成本,也没说客服未交给 AI 的近一半工单里安全类占多少。

    下一步 看 Airbnb 下一份季报里支持工单由 AI 解决的比例,是否仍披露在近 45%。

  3. ChatGPT的Mac应用中的一个漏洞可能让黑客获取敏感数据

    行业动态Wired AI

    ChatGPT的Mac应用中的一个漏洞可能让黑客获取敏感数据
    ChatGPT Mac版漏洞已修补,提醒AI客户端自身也是攻击目标。

    Mac 版 ChatGPT 的用户、以及给 AI 客户端配权限的 IT 管理员,要把它当成可被本地恶意软件接管的入口来划定信任边界,而不是只确认客户端更新到了最新版。

    展开全文

    依据

    Objective-See Foundation(专注 macOS 的安全研究机构)软件分析师 Patrick Wardle 说,AI 代理要干活就得要大量访问权限,像握着所有房间钥匙的楼管。机制在签名校验上:ChatGPT 的 macOS 版各组件靠数字签名互相确认身份,还专门要求校验发起请求进程的父进程与祖父进程,防止恶意软件拿 OpenAI 组件当代理发出「看似可信」的请求。但 Wardle 的概念验证(proof of concept)显示,链上有个 script interpreter(脚本解释器)会接受不受信任的脚本,恶意脚本只要连着 spawn 三次脚本解释器再发请求,就满足那三层校验,把命令送进主 ChatGPT 进程;他称利用方式「极其简单」,只需大约十几行代码。OpenAI 在 9月25日的系统变更日志里承认了该漏洞与修复。前提是攻击者已在目标机器上装有恶意软件;得手后可读取全部聊天记录,并让 ChatGPT 代开浏览器等应用。

    1. 本地恶意脚本
      投递不受信任脚本
    2. 脚本解释器连开三次
      签名校验放行
    3. 主 ChatGPT 进程
      读取应用数据
    4. 聊天记录与浏览器会话
    从本地恶意脚本到 ChatGPT 主进程数据访问的利用链

    没写清 材料没说这个漏洞在 9月25日修补之前是否已被在野利用,所以不能替它写成「从未被利用」。

    下一步 11月 Objective by the Sea 会议上 Wardle 的演讲,看他提交给 OpenAI 的 Dots 集成漏洞报告会不会有公开结论。

  4. 行业动态MIT Technology Review AI

    别被骗了——LLM不会推理
    以围棋第37手为由证明LLM不会推理,反例虽旧,却戳中能力边界的争论

    如果你在医疗、工程或科研场景评估 LLM,这份观点要求你把验收标准从“答得对”改到“能拿出可检查的推理状态”;否则 next-token prediction 的中间步骤仍不可追溯。

    展开全文

    依据

    作者 Thore Graepel 参与构建 AlphaGo,他回看 2016 年首尔那场五局赛:第二局第 37 手被 policy network(策略网络,负责猜强人类会走哪)判为专家人类大约 one in 10,000 才会走的选择,是 search machinery(搜索机制,负责展开并搜索游戏树)把它推了出来;AlphaGo 最终 4-1 击败李世石。作为对照,Deep Blue 在 1997 年靠人类硬编码规则,每步向前看 six to eight moves ahead per player,每秒评估 200 million 个国际象棋局面。今天 LLM 只反复挑 next token(下一个词元),chain of thought(思维链)仍由同一 next-token prediction 迭代产生,没有独立搜索;材料列出 Three shortcomings:没有显式、持久、可检查的 epistemic state(认知状态),知识与如何操作知识之间未分离,以及思维链常在答案出来后编造。医学、工程、科研不只问结论,也问结论怎么来。

    1. policy network 给候选
      供候选
    2. search machinery 展开游戏树
      复核
    3. Move 37 被选中
    AlphaGo 从直觉候选到搜索复核再到 Move 37,对照 LLM 只有 next-token prediction。

    没写清 材料没有给出今天任何具体 LLM 在医学、工程或科研任务上因缺少独立搜索机制而失败的可核对案例或基准分数,因此不能替它补上失败率或对比成绩。

    下一步 下一步可核对的是:是否有团队公开把显式的可检查推理状态与 next-token 模型分离,并在医学或科研任务上给出可复核的对照结果。