跳到正文

2026年10月09日AI 版

7 条 · 5 个来源

头版

[AINews] 今天没发生什么大事

行业动态Latent Space

[AINews] 今天没发生什么大事
内容仅一句“a quiet day”,对科技从业者无实际信息增量,可跳过。

做 agent 成本路由的人这周该换默认模型:Sonnet 5.5 的缓存读取降到 $0.10/百万 token,Anthropic 估算多数 agentic 工作便宜约 20%;而 Haiku 5.5 一旦上下文超过 100k,单价涨 5 倍。

展开全文

依据

Vals 把 Haiku 5.5 与 Haiku 4.5 逐项对比:同一条 Legal Research 上推理步数是 59 对 17,结果它在每个共同基准上的单次测试成本都更高;其 API 报价为 $0.10/$0.50 每百万输入/输出 token,与 GPT-6 Luna 持平,但超过 100k token 上下文后价格上涨 5 倍。另一侧,Anthropic 把 Sonnet 5.5 的缓存读取(cache read,指复用已缓存的提示前缀、只按读取量计费的那部分)降到每百万 token $0.10,输入 $2、输出 $10,官方估算这让大多数 agentic(自主多步调用工具的)工作便宜约 20%,且 Claude Code 的限额不变。两边叠起来,选型的判据从「哪家单价便宜」变成「这条任务的上下文会不会越过 100k」,因为越线之后省下的缓存钱会被 Haiku 5.5 的涨价吃掉。

  • Haiku 5.5 输入$0.10/百万 token
  • Haiku 5.5 输出$0.50/百万 token
  • Sonnet 5.5 缓存读取$0.10/百万 token
  • Haiku 5.5 超 100k 上下文价格涨 5 倍
Haiku 5.5 与 Sonnet 5.5 的单价,以及 Haiku 5.5 跨过 100k 上下文后的涨幅。

没写清 材料没给真实 agent 工作负载下的缓存命中率,也没有 Haiku 5.5 跨过 100k 后的实测单任务账单,所以那 20% 和 5 倍无法折算到同一条任务上做净额比较。

下一步 Vals 或 Roboflow 下一次跑 Legal Research 时公布的整条任务 token 账单与缓存命中率。

行业动态

4 条

  1. 她设计了Meta的新AI标志。然后仇恨来了

    行业动态Wired AI

    她设计了Meta的新AI标志。然后仇恨来了
    为Meta设计AI标志反遭网暴,自由设计师接大厂单前得先掂量舆论代价

    自由设计师再接大厂 AI 单子前,会把舆论反噬当成一项要单独定价的风险:要么在报价里加声誉溢价,要么提前备好公开解释的口径,而不是等作品上线后才在社交媒体上补辩护。

    展开全文

    依据

    设计师 Jessica Hische 在 Threads 上被同行围攻后回应:过去一两年客户项目很慢,两家实体店去年合计只有约 10,000 美元利润,账上常常只够发 2 到 4 次工资,她要养 4 个人的薪水。她为 Meta 新 AI 助手 Muse 的 M 标志做两天冲刺,报价 12,500 美元,超过两家店一整年的利润。机制在于:争议焦点不是 Meta 做了什么,而是「接单」这个动作本身。生成式 AI(用模型直接产出文字与图像的 AI 技术)在设计圈部分人眼里已是不该碰的合作对象,风险于是从下订单的公司转移到接单的个人身上。

    • Muse 标志两天设计费$12,500
    • 两家实体店去年利润$10,000
    • Studioworks 投入$100,000
    • Drawling 投入$30,000
    两天设计费与两家实体店全年利润的对照

    没写清 材料没有给出她因这次合作被取消的项目、流失的客户或收入变化,所以无法判断反噬是否已经变成实际经济损失。

    下一步 看她下一次在 newsletter 或 Threads 上,是否提到因这次合作被取消或搁置的具体项目与金额。

  2. USA Today成为最新一家起诉OpenAI的出版商

    行业动态The Verge AI

    USA Today成为最新一家起诉OpenAI的出版商
    版权成本正被逐案计价,OpenAI内容采购压力进一步加大

    USA Today Co. 把旗下地方报纸并进同一份诉状后,OpenAI 法务谈内容授权时得先给整个报业集团报打包价,而不是按单家报纸逐案封顶;继续拆开谈,就等于让每一家都拿这份诉状当参照。

    展开全文

    依据

    USA Today Co. 在周四提交的诉状中称,OpenAI 复制其「数十万篇」文章训练模型,索赔超过 $250 million(million 即百万),并称这种未获授权的使用造成「真实且持续」的损害。它把 The Tennessean、Indy Star、The Columbus Dispatch、The Oklahoman 等地方报纸写进同一份文件。机制是原告名单可复制:OpenAI 若按单家报纸逐案谈授权,每家都能拿这份诉状里的同一索赔额做定价参照,报价成本随名单长度上升,而不随内容用量上升。材料里已出现的对照是,OpenAI 还面对 The New York Times、The Intercept、CNET 母公司 Ziff Davis、CBC/Radio-Canada、Encyclopaedia Britannica、Merriam-Webster、The Seattle Times,以及近 400 家地方报纸组成的联盟。

    • USA Today Co. 索赔额超过 $250 million
    • 地方报纸联盟规模近 400 家
    本诉索赔额与此前近 400 家地方报纸联盟的规模对照。

    没写清 材料没写 OpenAI 的回应,也没写这 250 million 是侵权赔偿口径还是授权要价口径,不能替它折算。

    下一步 下一步可核对的是:本案之后,OpenAI 是否与任一报业集团公布打包授权或和解金额。

  3. 合成超智能:从半导体到超导体——Periodic Labs的Liam Fedus和Ekin Dogus Cubuk

    行业动态Latent Space

    合成超智能:从半导体到超导体——Periodic Labs的Liam Fedus和Ekin Dogus Cubuk
    听着像硬核科幻,但两位作者真要打通材料发现到制造的链路。

    Periodic Labs 把材料与器件团队的立项口径从“模型预测够不够准”改成“失败实验能不能自动回收进训练集”;代价是先背高吞吐实验室的资本开支,只有肯把负结果入库的团队才该跟。

    展开全文

    依据

    Liam Fedus 和 Ekin Dogus Cubuk 在 Latent Space 说,智能必要但不充分,物理实验才是 ground truth(最终判据)。他们要把 reinforcement learning(强化学习,即让模型按实验结果的奖励调整策略)接进材料发现循环:先预测候选,再自动合成与表征,失败的实验也不丢,回训模型。对照数字来自 Chris Barber 的投票:10B 美元以下新实验室里,Core Automation 拿 32 票,Periodic Labs 拿 26 票;这说明 Periodic 押的不是现成人才规模,而是把每台仪器变成能自主判断的节点,并靠负结果数据摊薄试错成本。换句话,材料团队若只买模型不买自动化实验能力,闭环最可能断在表征和失败样本回收那一步。

    1. 提出候选
      合成
    2. 自动合成
      表征
    3. 表征测试
      回收
    4. 负结果回训
    材料发现闭环:预测、合成、表征、失败回训。

    没写清 材料没说单次自动实验的成本、表征吞吐和负结果入库率,所以没法算出这条闭环多久回本、在多大概率上比纯算力筛选更省。

    下一步 下一步可核对:Periodic 是否公开首条自主实验线的连续运行周数,以及失败实验被回收为训练样本的比例。

  4. 行业动态Simon Willison

    引用卡森·格罗斯
    仅一句转引缺上下文,价值取决于原文,慎当独立观点看

    别把这条当成可独立引用的观点;要论证 AI 时代编程仍是可行职业,得回到 Carson Gross 的原帖,看清他的论证对象与适用范围,否则引到的只是 Simon Willison 摘录页上的一句转引。

    展开全文

    依据

    Simon Willison 在博客上贴了一句 Carson Gross 的话:编程从根本上讲是两件事——用计算机解决问题,以及在解决问题的同时控制复杂度;他难以想象未来「会用计算机解决问题、能控制方案复杂度」会比今天更不值钱,因此即使 AI 工具出现,这仍是可行职业。页面显示这条 quotation(转引帖)发布于 8th October 2026 的 9:05 pm。机制上,一句判断句被单独摘出后,读者看不到 Gross 在回应哪种「AI 取代程序员」的说法、也没看到他如何处理复杂度这一半论证,所以它只能当「有人这么主张」的样本,不能当论据。材料里可核对的数字是来源页的标签条目数:ai 2,269、careers 84、computer-science 16、carson-gross 4,这条转引所在的 carson-gross 标签在站内体量最小。

    • ai 标签2,269 篇
    • careers 标签84 篇
    • computer-science 标签16 篇
    • carson-gross 标签4 篇
    Willison 站内四个标签的条目数对比,carson-gross 只有 4 条

    没写清 材料没有给出 Gross 原帖的出处和他当时在回应什么,所以无法替他补上这句判断针对哪类岗位、哪类取代论。

    下一步 找到 Carson Gross 的原帖,核对这句判断的上下文与发布时间,再决定是否引用。

AI工具

2 条

  1. Anthropic为开源项目推出免费AI安全扫描

    AI工具The Verge AI

    Anthropic为开源项目推出免费AI安全扫描
    开源项目可免费获Anthropic定期扫描,代价是报告纯模型生成无人工复核

    开源维护者现在要定的是:要不要把仓库选进 OSS Scanner。免费扫描换来的是没人分诊的模型报告,接之前得先有能处理这批告警的人,否则预警直接变成积压。

    展开全文

    依据

    《The Verge》的 Stevie Bonifield 在 10月8日 的报道中引 Anthropic 的话:主动选入(opt-in)的开源项目可免费获得「由我们最强模型进行的彻底、定期安全扫描」,模型包括 Claude Mythos。机制是 OSS Scanner(OSS 指开源软件)产出的报告全部由模型生成,不经人工复核或分诊(triage,即判断哪条告警值得跟进的环节),所以扫描能更快更频繁,报告也可能错误或无效。材料自己给的对照是两件事同时成立:AI 找到过实打实的漏洞,「Copy Fail」在 5月 波及几乎每一个 Linux 发行版;而 Linus Torvalds 和 Google 也正在应付 AI 生成漏洞报告的涌入。

    没写清 材料没给扫描频率、单项目报告数量和误报率,所以没法算出维护者这边要额外分诊多少条。

    下一步 下一步可核对 Anthropic 是否公布 OSS Scanner 的扫描频率与误报数据,或首批选入项目披露的报告量。

  2. AI工具OpenAI

    Oracle如何借助ChatGPT和Codex将数天的工作变成几分钟
    Oracle把专家经验沉淀成可复用流程,省下的是重复人力,门槛在于前期梳理。

    这决定企业推 AI 时先动哪个岗位:优先挑那些专业答案早已写在文档里、只是需要人反复转述的环节,而不是从最缺人手的岗位开刀。

    展开全文

    依据

    OpenAI 在标题与摘要里说,Oracle 在招聘、工程、运营三条线上,把专家知识通过 ChatGPT Work(面向企业的 ChatGPT 工作入口)和 Codex(能读写并执行代码的模型)转成快速、可重复的工作流,把原本以「天」计的活儿压到以「分钟」计。机制上省掉的是转述成本:专家的判断一旦被固化成提示或可执行脚本,同事不必再排队等人答一遍。但材料只给了这一句概述,没有岗位数、没有改造前后的耗时对照,也没说这三条线里哪一条先跑通,所以「天变分钟」目前只是官方口径的量级描述,而不是可核对的实测。

    没写清 材料没给 Oracle 的部署规模、参与人数或改造前后的具体耗时,因此无法判断这套做法能在大组织里铺多宽。

    下一步 下一步可核对的是 OpenAI 或 Oracle 是否公布试点岗位数与单次任务改造前后的耗时对比。