跳到正文

2026年10月01日AI 版

7 条 · 5 个来源

头版

为什么Dwarkesh对Computer Use的看法是错的 + OpenAI如何在1周内推出其Jev竞品

行业动态Latent Space

为什么Dwarkesh对Computer Use的看法是错的 + OpenAI如何在1周内推出其Jev竞品
访谈含OpenAI团队一线复盘,做Agent的同事看交付节奏即可,结论未必通用

做 Agent 路由与编排的团队这周要拍板:把「下一步动作」的判定留在自家 harness,还是交给仍在 limited preview 的 Decisions API。省下的是缓存预暖与服务端压缩那套自建活,押上的是路由逻辑从此跟着 GPT-6 Luna 的版本走。

展开全文

依据

OpenAI API 团队的 Nikunj Handa 在 Latent Space 这期复盘里说,Decisions API 的冲刺「异常快」:开发者先定义问题和若干候选答案,由模型给内容分类、路由请求,或挑出 Agent 的下一步动作;眼下它就是一层 GPT-6 Luna 套壳(wrapper,把模型包成固定接口),团队自己承认是照着行业里现成的好模式克隆的。同期的 Ari Weinstein(Sky 创始人,现负责 OpenAI 的 Computer Use)说 CUA 与几个月前「180 度不同」,靠的是把截图、无障碍树、DOM、Playwright 和生成的 JavaScript 叠在一起,并让 Agent 学会自己调试、从失败里恢复。对照数字:DevDay 前后 Decisions API 公告帖 684K Views,Dwarkesh 质疑「computer use 为什么这么慢」的帖子 604K Views,Computer History 公告 107K Views。取舍很清楚:把路由判定挪进 Decisions API,你少养缓存预暖(pre-warming)和服务端上下文压缩(compaction)这套活,代价是把它绑在一个限量预览接口和 Luna 的迭代节奏上;留在自建侧,则要继续自己扛延迟与私有数据的说服成本。

  • Decisions API 公告684K Views
  • Dwarkesh 提问帖604K Views
  • Computer History 公告107K Views
三次公开发布的浏览量对照

没写清 材料没给 Decisions API 的延迟、定价和失败率,也没有它与自建路由的对照数据,这笔账不能替它算。

下一步 看 OpenAI 是否把 Decisions API 从 limited preview 转成正式可用,以及届时是否公布延迟与定价数字。

行业动态

4 条

  1. 即使没有AI,也有充分理由担忧生物武器的研发

    行业动态Wired AI

    即使没有AI,也有充分理由担忧生物武器的研发
    不谈AI也够警醒,生物武器研发的现实风险被长期低估。

    这项材料把生物武器风险从“AI 滥用”子题拉回到低门槛、难防御的主风险,生物安全政策制定者该重排优先级:先堵病原体获取与现场监测,还是继续把资源押在 AI 护栏上。

    展开全文

    依据

    Annie Jacobsen 在新书《Biological War: A Scenario》中对 Michael Mechanic 说,美国国防部大规模杀伤性武器威胁谱系把核武器列在曲线最远端,生物武器排第二;她认为生物武器整体威胁最大,因为进入门槛极低。她给的机制是:制造核武器需要武器级裂变材料,还要有洲际弹道导弹或核潜艇,因此你得是国家;而承担 containment(控制扩散)的是 nine 个核武国家,潜在大流行病原体却几乎人人可及。AI 这边,Anthropic 本月公开的“滥用”报告记录 five 起外国科学家试图绕过 Claude 对 gain of function(功能获得,即改造病原体基因使其更传染、更致命或更易在哺乳动物间传播)查询的护栏,Anthropic 拒绝回答并封号,同时说明动机未必恶意。Jacobsen 还指出政府应对生物战的能力有限,原文写到我们其实防不住。

    1. 外国科学家
      发起
    2. 功能获得查询
      触发
    3. Claude 护栏
      处置
    4. Anthropic 拒绝并封号
    Anthropic 报告中 five 起功能获得查询到封号的处理链

    没写清 原文没有给出各国现有生物防御预算、病原体获取难度分级或拦截成功率,因此无法判断资源该从 AI 护栏移走多少。

    下一步 下一步可核对:Jacobsen 书中引用的国防部大规模杀伤性武器威胁谱系文件是否能在公开渠道检索到,以及 Anthropic 那 five 起案例是否披露处置细节。

  2. AI拓麻歌子即将到来

    行业动态The Verge AI

    AI拓麻歌子即将到来
    Meta与OpenAI都押硬件,但前车之鉴显示用户未必买账

    这改变的是Meta与OpenAI硬件团队的上市时点取舍:先靠Dots、Muse Charm这类可爱代理养成依恋,再把用户迁移到要充电、要随身带的专用设备。若迁移失败,Meta在2026年假日季先付库存与退货成本,OpenAI则可退到2027年2月后。

    展开全文

    依据

    The Verge的Hayden Field(海登·菲尔德)在2026年9月30日报道,Meta与OpenAI都在做个人AI硬件:OpenAI与Jony Ive合作,公开文件称最早2027年2月出货;Meta计划在2026年假日购物季前推出挂坠式Muse Charm。Sam Altman(萨姆·奥尔特曼)被问Dots是否会进入硬件时只说“似乎很合理假设我们某天可能做”,未给细节;Mark Zuckerberg(马克·扎克伯格)则把Muse Charm比作钥匙扣,称不戴眼镜时它是和Muse对话、让Muse看周围的最快方式。机制是先用Dots、Muse这些可爱软件代理培养使用习惯和依恋,再让用户为专用设备承担随身带、充电和额外购买的成本。对照物是Friend和Humane AI Pin:它们先做专用硬件,主要招致 frustration and backlash(挫败与反弹)。所以Meta更急,若假日季卖不动,库存和退货成本由它先付;OpenAI把时间放到2027年2月之后,代价是可能失去先手,但能等Dots先验证需求。

    1. Dots、Muse软件代理先行
      培养
    2. 用户养成依恋与使用习惯
      迁移
    3. Muse Charm / OpenAI 硬件上市
    Meta与OpenAI先推软件代理、再让用户迁移到硬件的两步策略。

    没写清 用户对Dots、Muse的依恋能否迁移到专用硬件,以及迁移比例,材料没给。

    下一步 Meta是否在2026年假日购物季前正式发布Muse Charm,并公布售价与续航。

  3. 以下是AI领袖们对Trump新安全计划的看法

    行业动态The Verge AI

    以下是AI领袖们对Trump新安全计划的看法
    特朗普把AI安全说成民主党骗局,监管让位企业互盯,同事该看清代价

    对企业AI采购与安全合规负责人来说,供应商『等联邦法规落地』这张牌作废了:验收标准要改成合同里可核查的证据条款,否则模型出事时,责任由采用方自己承担。

    展开全文

    依据

    特朗普在9月30日与大型科技公司负责人餐后问答中说,他此前把AI安全担忧称作民主党炮制的『hoax』(骗局),如今技术改称『Super Intelligence』(超级智能),那套说法便不再适用;被问政府护栏不足时,他以美国公司正『dominating China』(压过中国)作答,替代方案是『世界上最聪明的人互相盯着』。被盯的六人是 Google 的 Sundar Pichai、Anthropic 的 Dario Amodei、Meta 的 Mark Zuckerberg、OpenAI 的 Greg Brockman、xAI 的 Elon Musk 和 Nvidia 的 Jensen Huang,他们签署 Joint Commitment on Frontier Responsibilities(前沿责任联合承诺),措辞为『morally binding』(道德上有约束力),企业按常识性准则自我监管,原文写明违反没有后果。机制是举证责任反转:政府不再举证,同行与客户的追问成了唯一成本,违约方获益,出事后的成本转到采用这些模型的下游企业。黄仁勋同场给出对照:这轮建设在美国创造『a million』个岗位——用就业与基建叙事替换了安全议题。

    没写清 这六家公司承诺条目里具体写了哪些准则、第三方是否获得核查权,原文未提,因此无法判断『没有后果』是纯粹无罚则,还是另有未公开的执行渠道。

    下一步 等六家中任一家按该承诺发布安全评估或政策文件,核对其中是否写明违规后的处理方式与核查方。

  4. 行业动态Simon Willison

    他建造了这座城市
    Simon Willison讲城市建造,创意过程比成品更值得看。

    近期在纽约、愿意为一件作品腾出半天的人,把 10 月 12 日闭展前的行程留一个位置给这座模型;但若你想带走的是 21 年怎么一步步改出来的过程,现场给的多半是成品,那部分只能自己另找记录。

    展开全文

    依据

    Simon Willison 在 9 月 30 日的笔记里说,他当天去纽约市博物馆看了《He Built This City: Joe Macken's Model》,那是一件 50 x 27 英尺的城市模型,用巴尔杉木(balsa wood,做模型用的极轻木材)和纸板做了 21 年,观感超出他原本已经很高的预期,他给出的动作是:闭展日 10 月 12 日之前优先去看。取舍出在展览这种媒介上:50 x 27 英尺的实体一旦入场,占掉的是展厅面积和参观者的注意力时长,参观者先拿到的是结果;21 年里的试错、拆改、换材料能否同时摆出来,取决于策展怎么分配这点空间,而不是取决于作品本身有多长的时间跨度。对拿半天来换一趟的人来说,这意味着买到的是成品,方法要靠别的渠道补。

    没写清 材料没说展览是否呈现 21 年的制作过程——草图、试件、返工记录在不在现场——所以不能替它确认这趟参观能补上过程这一课。

    下一步 10 月 12 日之前查一次纽约市博物馆该展的官方页面,核对闭展日期与展品说明里有没有提到制作过程相关的内容。

精选深读

2 条

  1. Google发布Gemini 4,并称其能力过强,目前只有“受信任的网络防御者”才能使用

    精选深读The Verge AI

    Google发布Gemini 4,并称其能力过强,目前只有“受信任的网络防御者”才能使用
    谷歌因网络安全限制首发,普通企业短期只能排队等开放

    企业 AI 采购负责人这季度不该把 Gemini 4 Argon 放进选型清单:首发只给一批『可信网络防御方』,普通企业连试用入口都没有,能做的取舍只有先押刚发布的 GPT-6.1 Sol,还是把预算留成期权等放开——后者的代价是这段时间的代码库迁移只能用手上的旧模型硬跑。

    展开全文

    依据

    谷歌首席 AI 架构师、DeepMind 高级副总裁 Koray Kavukcuoglu 说,Gemini 4 Argon 在真实软件工程、法律与金融这类企业知识工作、以及网络安全防御上都能拿到前沿表现,但同一次表态里他宣布首发只开放给一批『可信网络防御方』,并称谷歌正在参与美国政府针对模型预发布访问的自愿流程(即让政府在模型正式上线前先行接触的机制),之后逐步扩大。他另外提到,该模型已经在谷歌内部工作流中承担大规模代码库迁移。对照数字在时间点上:Argon 在 OpenAI DevDay 的次日亮相,那场会推出的是 Dots 智能体和 GPT-6.1 Sol,而 OpenAI 同期还以安全顾虑为由放弃了原定的 GPT-6.1 Astra。两家在同一时间给了相反答案——一个先收窄分发再放开,一个直接把型号撤下;对采购方来说,前者意味着可用性不确定,后者意味着依赖单点供应商的风险。

    1. 谷歌内部工作流
      逐步放开
    2. 可信网络防御方
      同步参与
    3. 美国政府预发布流程
      防护先行
    4. 强化防护后扩大开放
    Argon 的访问闸门从谷歌内部一路收窄到少数防御方,再分层放开

    没写清 材料没说普通企业何时、按什么条件能拿到 Argon,也没提价格、申请入口或等待名单机制。

    下一步 盯谷歌下一次公告是否给出扩大访问的具体日期或申请入口。

  2. 精选深读Google DeepMind

    Gemini 4 Argon:我们前沿智能的下一个时代
    官方称新时代前沿却无评测细节,真实性待第三方场景验证

    官方只给了价格和 1 million token 上下文,没给任何评测分,所以工程团队这轮只能把 Argon 放进新项目候选池,而不是迁移存量生产任务——迁移得重跑整条评测与回归,这笔账现在没人替它买单。

    展开全文

    依据

    Koray Kavukcuoglu(Google DeepMind 高级副总裁兼首席 AI 架构师)在公告里称 Argon 在真实软件工程、法律与财务这类企业知识工作、以及网络安全防御上达到前沿水平,同时给出的是分阶段发布路径:先通过 Fairwind Program(邀请制、只面向受信任网络安全防御者的计划)小范围放出,并参与美国政府的前置模型访问流程。机制上,Google 交出的是一组商业参数而不是能力证据——上下文 1 million token(token 是模型处理文本的最小单位)、输入 2 美元/百万 token、输出 10 美元/百万 token、缓存输入按输入价打 95% 折扣,外加『数千名 Googler 已在内部使用』这条自述。全篇没有基准分、没有竞品同任务对照、也没有第三方复现,所以「前沿」目前只有官方口径在支撑,采购与迁移决策缺的是可比的数字。

    • 上下文上限1 million token
    • 输入价$2 / 百万 token
    • 输出价$10 / 百万 token
    • 缓存输入折扣95% off
    Argon 公布的上下文上限与价格档位,全部是官方口径。

    没写清 材料没给任何基准分、竞品同任务对照或第三方复现,能力是否达到它自称的「前沿」无法从这批信息里核实。

    下一步 看 Argon 是否公开第三方评测结果,或把 Fairwind 邀请制改成开发者自助申请。