跳到正文

2026年10月08日AI 版

8 条 · 5 个来源

头版

行业动态Simon Willison

引用本·阿弗莱克
无片段的引语稿,价值全看原文出处,别当独立报道读。

主编得改决定:这条不当独立报道发,只做成带原文链接的引语位。影视特效团队的判断也得分清——机器学习不是刚进这条管线,按 Affleck 的说法它已经待了很多年。

展开全文

依据

Ben Affleck 在 Simon Willison 的博客里被收录了一段引语,页面标注收录于 2026年10月7日。他说自己从小玩电脑,电影从胶片转数字后兴趣更浓,而视觉特效(VFX)工作流里用机器学习已经很多年。他讲的机制是:先把画面变成张量(tensor,即把每帧每像素的红绿蓝数值写成一串数字),再用卷积神经网络(convolutional neural network,他称这是 transformer 的前身,区别只在于同时计算量更大)在张量上找模式,也就是边缘检测和特征提取,定位到窗台这类边界,就能更省力地把绿幕抠掉换成别的东西。页面上的对照数字只有博客标签计数:python 1,286 条、machine-learning 69 条,跟影视产能无关。

  1. 张量(像素数值)
    输入
  2. 卷积神经网络
    找模式
  3. 边缘检测与特征提取
    定位边界
  4. 绿幕替换
引语里描述的抠像链路:从张量输入到绿幕替换,是 Affleck 的口述复述,不是已验证的生产步骤。

没写清 他讲的是哪部电影、哪一年、哪套特效管线,抠像环节有没有可量化的效率变化,材料都没说。

下一步 核对这句引语的原始采访或播客出处,确认完整上下文,以及 2026年10月7日到底是收录日还是发言日。

行业动态

4 条

  1. 这些研究人员让 AI 驾驶一辆丰田卡罗拉去 In-N-Out

    行业动态Wired AI

    这些研究人员让 AI 驾驶一辆丰田卡罗拉去 In-N-Out
    GPT、Claude、Grok真车实测GPT唯一成功,但案例太少别当普遍能力。

    把语言模型接进车辆控制的团队,现在该把 DrivingBench 的完赛结果降级为待复现线索:先补足每模型多轮成绩和脱离提示的自主性,再决定是否把真车控制链路纳入选型。

    展开全文

    依据

    三位 Axiom 的 AI 工程师 Aditya Ramabadran、Simon Mahns 和 Tobias Gessler 说,他们想测模型在混乱真实世界里的操作能力;Mahns 把车技归因于多模态规模扩大后出现的 emergent capability(涌现能力)。做法是把聊天界面接到服务器,服务器再连挡风玻璃摄像头和车辆电动助力转向,安全员脚放刹车上。模型起初拒绝发运动指令,经提示才接手。他们自建的 DrivingBench(车辆驾驶基准测试)在停车场简单赛道测驾驶:只有 GPT-6 Astra 完赛,且很慢;Claude Fable 5.1 走完 45 percent,Grok 只走完 11 percent。

    • Claude Fable 5.145 percent
    • Grok11 percent
    DrivingBench 完成度:Claude Fable 5.1 为 45 percent,Grok 为 11 percent。

    没写清 材料没说 DrivingBench 每个模型跑了几轮、是否只跑同一条停车场路线,也没说 45 percent 和 11 percent 是在几次尝试里取的最好值还是平均值。

    下一步 下一步可核对三人是否公开 DrivingBench 的逐轮记录与提示次数,并看 Astra 在多轮无提示下是否仍唯一完赛。

  2. Surface RTX Spark Dev Box 开放预购,售价 $5,999

    行业动态The Verge AI

    Surface RTX Spark Dev Box 开放预购,售价 $5,999
    六千美元开发机比DGX Spark还贵,缺内存的团队才需要考虑。

    手里有六千美元预算、要跑 120B 以上本地模型的开发者,现在要决定是为 128GB 统一内存接受高于 DGX Spark 的定价,还是等 RAM 缺货缓解再下单。

    展开全文

    依据

    The Verge 的 Stevie Bonifield 报道:微软这台 Nvidia 驱动的 Surface RTX Spark Dev Box 已开放预订,11 月发货,售价 5,999 美元,比 Nvidia 去年推出的 DGX Spark mini PC 更贵,报道把原因指向 RAM 等零部件短缺。机制在内存:128GB 统一内存(unified memory,CPU 与 GPU 共用同一池内存)决定单机能装下多大的模型,官方口径是可运行「超过 120B 参数」的模型,用于本地测试模型、原型化 AI 智能体或跑本地编码工具;100 瓦热设计功耗(TDP,芯片可长期散掉的功耗上限)配合 Nvidia Tensor 核心。同一场发布里,首批 Nvidia RTX Spark 笔记本最高到 7,000 美元,可作价格锚点。机器属于微软 Project Zenith,出厂即带开发者向 Windows 11 Pro 与 Visual Studio Code、Git、GitHub CLI、GitHub Copilot、WSL、Python、Node 等预装工具。

    • Surface RTX Spark Dev Box 预售价$5,999
    • 统一内存128GB
    • 热设计功耗100 瓦
    • 可运行模型规模超过 120B 参数
    这台开发机的价格与关键规格对照。

    没写清 材料没给 DGX Spark 的具体售价,也没说 RAM 涨价在 5,999 美元里占多少,两台机器的实际价差算不出来。

    下一步 等 11 月发货后的实测:128GB 统一内存是否真能装下超过 120B 参数的模型,并公布吞吐数字。

  3. 行业动态AWS Machine Learning Blog

    用 Amazon Quick 和 Amazon Bedrock 重新思考 RAG 的访问控制
    亚马逊在查询时回源核验权限,代价是每次检索都多一次校验开销。

    企业检索增强生成平台负责人现在要把权限判断放在索引期还是查询期,因为 Amazon Quick 与 Bedrock Knowledge Bases 把查询期回源核验做成了一条可选路径;选它,检索链路每次都要多一次校验。

    展开全文

    依据

    AWS 的 Amit Choudhary 和 Surendran Raju 在 AWS Machine Learning Blog 中称,Amazon Quick 与 Amazon Bedrock Knowledge Bases 通过实时 ACL(access control list,访问控制列表)执行,让 AI 生成的答案遵守源系统的权限结构。机制是:企业把 SharePoint、Google Drive、Atlassian Confluence 等知识源接入 RAG(Retrieval Augmented Generation,检索增强生成)后,查询时直接向权威源核验权限,而不是只信索引里的权限副本。这样多部门共用同一个知识库时,成员只能拿到自己有权访问的文档片段;代价是每次检索都多一次校验开销,检索延迟和源系统可用性成为新变量。

    1. 用户提问
      提交查询
    2. 检索知识库片段
      候选片段
    3. 回源核验权限
      按权限过滤
    4. 生成回答
    这张图按查询链路画出 Amazon Quick 与 Bedrock 在检索中回源核验权限的步骤。

    没写清 材料没有给出查询时回源校验的延迟增量、源系统不可用时的降级返回,也没有说明缓存能抵消多少开销。

    下一步 下一步可核对 Amazon Quick 与 Bedrock Knowledge Bases 的 ACL 执行文档,看它是否列出延迟指标、缓存策略和校验失败时的返回规则。

  4. 行业动态AWS Machine Learning Blog

    超越节省的工时:为 Agentic 自动化构建商业论证
    RPA旧ROI算法漏算代理商价值,AI中台负责人可据此重排流程优先级。

    AI 中台负责人这次别用同一把尺子排流程优先级:规则稳定、量大者照旧按「工时×人力成本−建设成本」批预算,需要临场判断者换新口径立项,否则后者会在初筛里被排到最后。

    展开全文

    依据

    AWS 博客《Beyond hours saved: Building the business case for agentic automation》(2026年10月7日,Manish Ballal、Sumit Wasuja)面向 AI CoE(AI center of excellence,企业里统筹 AI 落地的团队)负责人,主张另建一套论证框架。文章说通行算法是「省下的工时 × 人力成本 − 建设成本」,它诞生于 RPA(robotic process automation,按固定规则重复执行事务的自动化)时代:默认流程稳定,于是流程一变,维护自动化的开销不落在它账上;agentic automation(能推理并随情况调整步骤完成任务的软件)在规则之外做成的事,也不进这张账。同页推广语另写有「88% 的 agent 试点停滞」,文章未把它与旧口径挂钩。

    • agent 试点停滞88%
    材料里唯一一个带量级的数字:agent 试点停滞比例。

    没写清 原文在「It assumes…」处截断,新框架把规则外产出折成金额的算法、以及维护自动化的开销由谁承担,都没写,不能替它补。

    下一步 等这篇 AWS 博客更新后续章节,核对它是否给出把「规则外任务」折成金额的公式或度量清单。

AI工具

1 条

  1. 微软正让 Copilot 对 Windows 和你的文件拥有更多控制权

    AI工具The Verge AI

    微软正让 Copilot 对 Windows 和你的文件拥有更多控制权
    微软让Copilot读本地文件并跨系统操作,效率提升的代价是隐私边界再退一步。

    Copilot 拿到了本地文件的读写权,先要改决定的是企业 IT 管理员:部署前得划出允许扫描的目录白名单,因为检索、改名、打包、发信共享同一份文件授权,目录划多宽风险就落多宽。

    展开全文

    依据

    微软 Copilot 执行副总裁 Jacob Andreou 在 Surface 活动上演示:他告诉 Autopilot 自己收到了会计的邮件,Autopilot 随即跨文件夹找文档、给文件改名、打包成 zip、再起草一封带附件的邮件发给会计。支撑这套动作的是 Hybrid Intelligence(混合智能),即一部分推理跑在本地模型、一部分跑在云端模型,本地那一侧要能读文件才找得到文档、要能写文件才改得动文件名。机制上的差别在于:改名和打包的结果落在硬盘上,不像聊天窗口里答错一句可以忽略。Jacob Andreou 说这类功能会在接下来几个月推给 Copilot;Windows 与 Surface 负责人 Pavan Davuluri 说新的搜索体验今年秋天先上 Windows 11 电脑。

    1. 跨文件夹检索文档
      取到文件
    2. 重命名文件
      整理
    3. 打包成 zip
      附上
    4. 起草带附件邮件
    Autopilot 处理税务邮件的四步动作演示

    没写清 材料没说 Copilot 能扫的目录是整块硬盘还是用户勾选的范围,也没说改名打包后能不能撤销、有没有操作记录。

    下一步 接下来几个月内,看微软在 Copilot 设置页里是否给出可勾选的目录范围和可查的操作历史。

精选深读

2 条

  1. 新的 ChatGPT 更重展示而非讲述

    精选深读Wired AI

    新的 ChatGPT 更重展示而非讲述
    ChatGPT 新版主打视觉交互,普通用户先受益,但生成式界面稳定性仍待验。

    OpenAI 把 ChatGPT 的回答从文字墙改成按需生成的可交互界面,付费用户当天先用、免费用户次日跟上;设计与产品团队要定的是「哪些问题值得配图」这条判断线,而不是每问必配一个图。

    展开全文

    依据

    OpenAI 产品经理 Aarush Selvan 对 WIRED 说,设计团队花了大量时间判断加图表、示意图或按钮何时有价值、何时开始显得杂乱——所以并非每条回答都会带图。机制上,这次更新名为 Intelligent UI(智能界面),由 GPT-6 模型驱动,付费用户当天先在 ChatGPT 用到、免费用户次日开放,覆盖超过 10 亿用户;不想看图的用户可以直接要求少生成视觉内容。可对照的是 Google 今年早些时候在搜索里推的同类做法,叫 generative UI(生成式界面),同样按查询生成可调图形。WIRED 记者拿到的只是上线前一次快速上手:蛞蝓解剖图、旧金山房租负担计算器、四架阿拉斯加航空与达美航空客机的座位对比工具。

    1. GPT-6 模型
      当天
    2. 付费用户开放
      次日
    3. 免费用户开放
    ChatGPT 智能界面的开放顺序:先付费、后免费。

    没写清 材料只有上线前一次快速上手,没有生成失败、生成卡住或退回纯文本的发生率。

    下一步 免费用户开放后,看 OpenAI 是否公布视觉回答的失败率或被用户关掉视觉的比例。

  2. 精选深读Hugging Face

    面向边缘的多模态开放 d1 决策模型
    边缘端跑多模态决策模型,带宽和算力受限,落地价值得看具体场景。

    客服分诊、工单紧急度这类判定原本要回传云端或上 4B–9B 模型,现在可以改放 Jetson Orin Nano 本地跑 d1-3B;选型门槛从「有没有网」换成「50 ms 够不够」。

    展开全文

    依据

    LiquidAI 的 Aurelien Lac、Fernando Fernandes Neto、Edoardo Mosca、Maxime Labonne、Leonie Monigatti 在 Hugging Face 发文(2026年10月7日),发布 d1-3B 与实验性的 d1-omni-600M。机制上,决策模型(decision model)不逐 token 生成文字,而是在单次前向(single forward pass)里直接给出结构化答案,所以省掉了自回归解码那一段耗时。d1-3B 从 LFM2.5-VL-3B 这个视觉语言模型(VLM,decoder-only)训练,吃文本和图像;d1-omni-600M 从 LFM2.5-Encoder-350M 这个双向编码器训练,另加视觉与音频编码器,只吃文本+图像或文本+音频。对照数字:d1-3B 在 Decision Index 0.2.1 上得 48.57,高于 Decider 35B-A3B 的 47.11;七个公开数据集均值 82.9,d1-omni-600M 得 78.4,超过 Decider 2B 的 77.1,而参数量只有其四分之一。延迟上 d1-3B 单问 16 ms(Jetson AGX Thor)、26 ms(Jetson AGX Orin 64 GB)、50 ms(Jetson Orin Nano),三问只花一问的 1.3 倍,Thor 从 16 ms 到 20 ms。

    • Decision Index 0.2.148.57
    • 七数据集均值82.9
    • Jetson AGX Thor 单问16 ms
    • Jetson Orin Nano 单问50 ms
    d1-3B 的决策指数、七数据集均值与两款 Jetson 上的单问延迟。

    没写清 d1-3B 的视觉准确率和 d1-omni-600M 的音频决策基准都没公开,Decision Index v0.3 只有私有视觉分片,所以无法替材料断言多模态判定在真实工单里够用。

    下一步 等官方补上 d1-omni-600M 的速度数字与音频决策基准,再决定要不要把它放进语音工单通道。