跳到正文

2026年10月04日AI 版

8 条 · 5 个来源

头版

行业动态Simon Willison

我们几乎需要对所有东西设置默认硬性预算上限
预算硬上限若成默认,厂商得先算清成本,免费额度时代或将收尾。

个人开发者现在得在「等 AWS 老账户默认硬上限一般可用(GA)」和「先迁到已可设硬上限的 Google Cloud 或 AWS 新体验」之间选:等,省迁移成本,但继续暴露在跑飞服务烧穿预算的尾部风险里;迁,付迁移和适配成本,换当月被暂停而不是被一张失控账单追着跑。

展开全文

依据

Simon Willison 在 2026年10月3日的博文里主张:按用量付费的 API 和服务应默认配硬性支出上限(hard budget cap,超过设定额度就切断并返回错误),而不是软上限(soft cap,只发警告邮件)。他的机制是 coding agents 与 personal agents 把起服务、调付费 API、开托管应用、加存储/算力的摩擦降到很低,一个跑飞的 agent 可在人睡觉时多烧掉数百到数千美元,所以宁可让应用报错,也不要醒来面对 10,000 美元以上账单。AWS 在 9月16日的新体验里给出月度 spend limit:项目用量达到上限后,当月暂停;但创建页面写明只向有限客户发布,现有账户还没普及。Google Cloud 在 7月上线 Spend Caps,允许对项目内特定服务设月度财务上限。对照下来,AWS 的老账户用户暂时拿不到默认保护,只能自己先设预算告警或迁到已有硬上限的路径。取舍是:硬上限会牺牲超限后的可用性,换掉账单失控风险;厂商若默认开启,也要承担误暂停和客户流失成本。

  1. 配置项目
    升级
  2. 升级到付费计划
    设置
  3. 设月度支出上限
    达到
  4. 用量达到上限
    触发
  5. 项目当月暂停
AWS 新体验从设置月度上限到项目当月暂停的触发链

没写清 材料没说 AWS 老账户何时 GA,也没说 Google Spend Caps 是否默认开启、覆盖哪些服务,所以不能替用户排定迁移时间表。

下一步 核对 AWS Settings 的 Create a spend limit 页面是否从 limited number of customers 改成对所有现有账户开放。

行业动态

6 条

  1. Nvidia Shield TV 已上市7年。它刚刚涨价100美元

    行业动态Wired AI

    Nvidia Shield TV 已上市7年。它刚刚涨价100美元
    AI抢内存让老设备也涨价,想捡便宜的 Shield TV 用户得再等等。

    想买 Shield TV Pro 的流媒体用户,现在得决定是付 $299.99 还是换更便宜的盒子;Nvidia 则要继续决定是否为这条小众产品线出货。

    展开全文

    依据

    Nvidia 发言人向 Ars Technica 确认:从 10月2日起 SHIELD Pro 定价 $299,原因是包括内存(memory,即设备里临时存放数据的芯片)在内的组件成本全行业大幅上涨。机制是 AI 数据中心抢购内存和存储,把上游价格推高;Shield TV Pro 2019 年上市,用老 Tegra X1+ 处理器,但没有涨价前囤的库存,所以新出货同样受供应链约束。对照数字:该机首发 $199.99,非 Pro 版首发 $149.99 且已停产,现价 $299.99;PS5 Pro 从 2024 年首发 $699.99 涨到今天的 $899.99。Andrew Bell 今年早些时候称 Shield 是 passion project(热情项目),Nvidia 仍在主动生产并卖掉每一台。

    • Shield TV Pro 首发$199.99
    • Shield TV Pro 现价$299.99
    • PS5 Pro 2024 首发$699.99
    • PS5 Pro 现价$899.99
    Shield TV Pro 与 PS5 Pro 的涨价幅度对照

    没写清 材料没有说明 Shield TV Pro 的物料成本具体涨了多少,因此无法判断 $100 涨幅是否完全由内存涨价解释。

    下一步 下一步可核对 Nvidia 官方商店的 Shield TV Pro 是否恢复现货,以及上架标价是否维持 $299.99。

  2. Splice CEO Kakul Srivastava 认为 AI 邮件正在扼杀对话

    行业动态The Verge AI

    Splice CEO Kakul Srivastava 认为 AI 邮件正在扼杀对话
    Splice CEO点破AI邮件反噬对话,创意行业协作者该警惕沟通被工具稀释

    这改变创意公司远程团队负责人的决定:要不要给文档加一道「谁写的」标注,并把「当面辩一遍」写进流程,而不只是口头提倡。Splice CEO 给的是理由,不是可照抄的规则。

    展开全文

    依据

    Splice CEO Kakul Srivastava 在《The Verge》10月3日的周末问卷里说,她最不可替代的工具是「一份写得清楚的文档,加一场关于它的真实对话」。Splice 是 remote-first(远程优先,指团队不共用同一间办公室、没有走廊可偶遇),替代做法是有人把一件事真正想透、写成文档,再由一群人当面反驳它——她说公司里几乎所有好事都这么开始。她因此对 AI 写的文档保持警惕:一旦看不出文字背后有没有人,围绕它的讨论就换了性质,而且回不去。这条边界她此前也划在音乐上:她公开反对「按键出歌」式 AI(Suno 那一类),同时 Splice 的采样进过 Lisa 的《Money》和 Sabrina Carpenter 的《Espresso》,还收购了 Spitfire Audio。同一把尺子——工具可以进流程,但发起讨论的那一步必须有人。

    1. 远程优先,没有走廊
      替代走廊
    2. 有人把问题想透并写成文档
      发起争论
    3. 一群人当面反驳这份文档
      前提被抽掉
    4. 看不出文字背后有没有人
      且回不去
    5. 讨论变成更差的那种对话
    Splice CEO 描述的这条链路:文档由谁写、怎么被反驳,决定了讨论会变成哪一种

    没写清 材料没说 Splice 内部是否已经给 AI 代写文档设了标注或审批规则,也没有任何远程协作产出、会议次数之类的量化对照。

    下一步 查 Splice 官方是否公开其内部文档的 AI 使用规范,或她下一次在 Decoder 露面时是否给出具体做法。

  3. 一位 OpenAI 安全员工已离职并发出警告

    行业动态The Verge AI

    一位 OpenAI 安全员工已离职并发出警告
    写安全报告的人离职才敢说,OpenAI治理问题恐怕比监管缺位更棘手

    把「厂商设有内部安全报告流程」写进采购或合规加分项的人,这次该改的是这一项的证据来源:报告照发,写报告的人已经离职并公开说文化已坏,买家不加一道复核,省下的尽调时间就转由上线后承担后果的那一方付。

    展开全文

    依据

    OpenAI 安全员工 David Robinson 本周辞职,并在 The Atlantic 撰文。他此前负责撰写 OpenAI 每次主要模型发布附带的安全报告;他说行业文化「fundamentally broken」(根本上已坏),硅谷靠「extreme confidence」(极端自信)和「perpetual sprints」(永不停歇的冲刺)把模型做大,主张前沿实验室应像核电站或繁忙机场那样运行,用多层冗余和耗时的规划,让不可避免的人为失误不至于打开灾难之门。机制在于:安全报告是外界能看到的少数内部评估产物,作者离职后报告仍按同一格式发布,买家读到的文本一字不变,判断这份文本是否还代表内部真实结论的人却换了;Robinson 是这轮里最新一位,此前已有 Anthropic 的 Jacob Coxon、Joe Benton 和 Google DeepMind 的 Robert O'Callahan、Bilal Chughtai、Josh Engels 公开离职发声。

    没写清 材料没给出 Robinson 经手的最后一份安全报告写了什么,也没说他与 OpenAI 的分歧是否落在某次具体发布上。

    下一步 看 The Atlantic 原文是否点名他负责的最后一次模型发布,以及 OpenAI 是否对此作出回应。

  4. [AINews] 今天没发生多少事

    行业动态Latent Space

    [AINews] 今天没发生多少事
    今日无大新闻,正好暴露行业依赖单一热点的节奏,适合团队补基础

    依赖热点排期的 AI 工程团队,应把本周决策从「追新模型」改为「补评测口径」:先确认 Sol 的 $0.56 每任务成本是否包含缓存与重试,再决定是否进入选型清单。

    展开全文

    依据

    OpenAI 把 GPT-6.1 Sol 定价为每百万输入/输出 token(模型计费的最小文本单位)2 美元/10 美元,而 Astra 是 10 美元/50 美元;Agent Arena(智能体任务榜单)记录 Sol [Max] 每任务中位成本 $0.56,比 GPT-6 Sol 便宜 39%,比 Astra 便宜 81%。同一榜单里 Sonnet 5.5 [Max] 排第 3,每任务 $2.74,比排第 2 的 Opus 5.5 的 $1.58 更贵,因此没进 Pareto frontier(帕累托前沿,指成本与分数同时占优的集合)。对预算敏感的团队,选型依据不是有没有大新闻,而是每任务成本与榜单分数的边际交换。

    • Sol [Max] 每任务中位成本$0.56
    • Sonnet 5.5 [Max] 每任务成本$2.74
    • Opus 5.5 每任务成本$1.58
    Sol、Sonnet 5.5 与 Opus 5.5 的每任务成本对照

    没写清 材料没有说明 $0.56、$2.74 这些每任务成本是否含缓存、重试与工具调用等全部开销。

    下一步 等 Agent Arena 或 OpenAI 公布 Sol 与 Sonnet 5.5 的完整成本口径时,再核对 $0.56 与 $2.74 是否可比。

  5. 行业动态Hugging Face

    Agent 说它做完了。数据库不同意。
    Agent自报完工却与数据库不符,暴露验收只看对话的盲区。

    负责 agent 上线的团队应把验收标准从对话是否收尾、工具调用是否合法,改到终端后端状态与副作用是否符合要求;否则工单该留 hold 却被标 solved 的 agent 会照样通过。

    展开全文

    依据

    微软与 Hugging Face 的 ThinkingBox 博文称,他们不看 agent 生成的句子,而是看它留在数据库里的记录,并让它对同一任务重复 20 次。文中案例是:一台 $745 的厨房电器在 Nashville 配送中心卡在 courier exception,已超预计送达日 fifteen days;agent 做了 nine tool calls,把工单状态写成 solved 并回复已解决,但承运商异常仍未关闭,要求的终止状态是 hold,客户也没得到真正答案。机制上,ThinkingBox 跨 507 个有状态业务流程、每项跑 20 次,按终端后端状态和副作用打分。共同集消融含 121,680 个有效试验、12 个 LLM(大语言模型),其中 79,853 次未通过可执行检查;这些失败里 67.24% 仍干净终止、调用过改状态工具且未报最终工具错误,可执行检查却发现 77.61% 有错误字段值、43.30% 有非预期额外效果、25.36% 缺少必需效果。

    • 有效试验121,680
    • 未通过可执行检查79,853
    • 失败中干净收尾67.24%
    • 失败中字段值错误77.61%
    ThinkingBox 用 121,680 个有效试验对照失败样本的收尾表现与字段错误。

    没写清 材料没说这套终端状态检查接到生产系统后,遇到并发写、部分回滚或人工接管时该怎么判,也没给真实流量下的误判率。

    下一步 下一步可复跑 sandbox_external_retail_group1.py:test_case_ST003_006,核对工单 status 是否从 solved 被标成 hold。

  6. 行业动态Simon Willison

    Rex 的恐龙商店
    无摘要可查,想省时间的同事只能自己点开验货。

    值班编辑把这条留在「其他」栏,不占大语言模型(LLM)版面:它没有模型名、版本号或价格,读者读完不会改动自己的任何决定。

    展开全文

    依据

    Simon Willison 在 2026年10月2日的短文里只记录了一件事:布鲁克林 Grand Army Plaza 地铁站闸机前的旧报刊亭现由一只恐龙经营,他称其中的恐龙双关语密度「exceptional」。这条落在他博客的 art 与 new-york 标签(tag,即分类标记)下,材料里没有模型名、参数规模或价格,只有站名、作者名和几篇往期文章标题。简报的取舍单位是「谁会因此改哪个决定」:一条只有地点和照片的笔记到不了这个门槛,把它排进 LLM 版面,代价是当天真正带版本号或价格的条目被挤后一位。

    没写清 材料没说这条为何发在以 LLM 为主的博客里,也没给任何模型、版本或价格信息,无法判断它是否该进科技简报。

    下一步 查 9月27日那篇《2026 in LLMs (so far)》是否含可引用的版本号或价格,有就用它替换此条。

AI工具

1 条

  1. Muse 为你所有朋友和家人创建详细档案

    AI工具Wired AI

    Muse 为你所有朋友和家人创建详细档案
    Meta的Muse用隐私换便利,下载量再大也得先掂量代价。

    给 Muse 接上银行账户、消息或健康数据的人,现在要决定的不只是装不装,而是先开哪几类权限:换来个便利助手,代价是它每小时为每位亲友建一份结构化档案。

    展开全文

    依据

    独立 AI 安全与隐私研究员 Karan Joshi 通过普通聊天界面让 Muse 复制并分享自身软件文件,提取出系统提示与操作说明;Meta 发言人 Daniel Roberts 回应称,助手要有用就需要关于你和交互对象的上下文,数据来自公开信息和你选择分享的内容。机制上,材料说 Muse 的指令允许它“为用户生活中的每个人建一个页面”,这个每小时跑一次的过程会汇编家人、伴侣、朋友、同事、合作者和你关注的人的数据,页面可含 Facts(事实)、History(历史)、The relationship(关系)、In common(共同点)、Open threads(未结线索)、Strengthening(强化关系)等栏目,并用结构化文本文件充当 memory(记忆)。Meta 强调每个用户有独立 virtual machine(VM,虚拟机)存放数据,可清空记忆或断开外部服务,发邮件或购物前会请求人工确认,并有审计日志;但对已授权的人,取舍是便利越具体,关系细节越被留存。Miranda Bogen 说 Muse 对关系和个人联系的侧重比竞争对手更明显。

    1. 用户授权接入银行/消息/健康数据
      触发
    2. Muse 每小时为每位亲友建档
      填充
    3. 按 Facts/History 等栏目填充
      建议
    4. 生成改善关系建议
      行动前
    5. 发送邮件或购买前请求确认
    Muse 从授权数据到建档、建议、行动前确认的链路

    没写清 材料没说这些亲友档案是否只整理用户主动授权的数据,还是也会从未使用 Muse 的亲友处或外部来源拼进来。

    下一步 下一步可核对 Muse 设置里能否逐人查看、导出或删除人物页,以及断开银行或健康服务后旧档案是否同步清空。