跳到正文

2026年09月16日AI 版

8 条 · 7 个来源

头版

行业动态Wired AI

AI“演员”Tilly Norwood 告诉我“所有生命都重要”
虚拟演员回避政治却谈服装,提示品牌代言风险仍无解。

Particle 6 若还要拿 Norwood 接品牌代言,得先把无随行把关人的开放采访改成人工审核问答;代价是失去「ready for anything」的卖点,但能避免模型自动说出「all lives matter」这类高敏感口号。

展开全文

依据

WIRED 记者 Miles Klee 在 2026年9月15日的测试里,Particle 6 让他不设 handler(随行把关人)直接问 Norwood。Norwood 拒答俄乌冲突,称有「strict policy」——即严格避开人类冲突的政策;但被问「Do Black lives matter?」时却答「all lives matter」。这不是它主动选边,而是生成模型在缺少政治与种族敏感训练边界时,把右翼常用来反驳 Black Lives Matter 的口号当成安全通用句。它同时对编造丑闻和地缘政治绕开,却会反复评论你穿的衣服。Particle 6 把可访谈版本说成与「actor」(演员模型)不同的系统,并开放 9月16日至19日公开视频通话:前两分钟之后,$14 续聊 15 分钟,$25 续聊半小时,收入捐慈善。品牌方若买这套代言,省下的是真人政治风险,换来的是模型不可预测的伦理风险;加人工审核会削弱「ready for anything」的开放卖点,不加则可能在直播里重演同一口号。

  • 额外15分钟$14
  • 额外半小时$25
Tilly Norwood 公开视频通话的付费档位,数字照抄 WIRED 原文。

没写清 材料没说 Particle 6 对政治与种族口号有没有审核规则,也没说「actor」模型与可访谈模型具体差在哪,不能替它补上风险控制是否存在的结论。

下一步 可核对的是 9月16日至19日公开视频通话里 Norwood 是否再次输出政治口号,以及 Particle 6 是否同步发布问答边界说明。

行业动态

3

  1. 行业动态MIT Technology Review AI

    圆桌讨论:AI 真的会杀死我们所有人吗?
    顶尖AI实验室员工自己担心灭绝,这比外界质疑更值得听内部理由。

    给写AI风险预案的治理与安全负责人:这场圆桌不给概率也不给证据链,别把它当立项依据。要定的是——把顶尖实验室员工自己的担忧按岗位利益折算之后,还剩多少可以采信。

    展开全文

    依据

    MIT Technology Review这场圆桌提出的重点不是“AI可能灭绝人类”这个结论,而是提出者身份:顶尖AI实验室的员工自己担心灭绝。编辑部把讨论落在三处:这种担忧从何而来、是否站得住脚、若成立该做什么。机制在位置——最接近模型训练与部署的人,可能比外部更早看到能力边界,但同一批人的结论也牵动自己的岗位评价与项目预算,所以担忧的信息含量高,方向却可能被激励结构扭曲。原文没有给出任何具体风险概率或技术证据链,因此内部人身份提高的是这条线索的可听度,不是风险门槛的可验证度。

    没写清 材料没有说明这些员工所依据的具体失效路径、涉及哪些岗位或多少人,也没有量化门槛,所以无法替它补上“担忧是否成立”这一步。

    下一步 下一步只核对一件事:原始圆桌记录里是否出现任何具体风险路径或量化门槛;若没有,就不要把它填进内部风险评估的证据栏。

  2. 行业动态AWS Machine Learning Blog

    宣布推出 Amazon SageMaker AI 训练任务的实例偏好列表
    SageMaker按序自动选容量,省去重试脚本,但仅限训练与处理作业。

    把训练与处理作业的实例回退逻辑从自建脚本挪进作业配置的人,是平台工程师与 ML 运维;他们不用再维护重试循环,但推理端点的容量选择仍得自己扛。

    展开全文

    依据

    AWS Machine Learning Blog 在《Announcing instance preference lists for Amazon SageMaker AI training jobs》中宣布,SageMaker 训练作业支持「实例偏好列表」(instance preference list,即按优先级排序的实例类型清单)。机制是提交作业时给出有序清单,SageMaker 依次尝试,前一种容量不足就落到下一种,而不是让作业直接失败,因此原先写在作业外部的重试与换型脚本可以删掉。覆盖范围限于训练作业与处理作业,这是标题与策展点评共同给出的边界,推理端点不在其中。

    没写清 材料只有标题与站点导览文本,没写偏好清单的长度上限、跨可用区行为,也没写退到次选实例时是否按新容量重新计价。

    下一步 核对公告原文:实例偏好列表是否也覆盖处理作业,以及是否带区域或实例族限制。

  3. 行业动态Hugging Face

    你的 Agent 完成了任务。它还能再做一次吗?
    单次跑通不算数,可复现性才是智能体落地的真实门槛。

    决定把 ReAct 智能体接进对账、合同核查这类流水线的人,验收口径要从平均成功率改成同一任务连跑五次全对的比例,否则按 77.4% 签下的上线时间表仍会随时反悔。

    展开全文

    依据

    IBM Research 的 Evelyn Duesterwald、Lilian Ngweta 等作者在 Hugging Face 发文给出对照:在 AppWorld 的 test_normal 上,用 GPT-4.1 的 ReAct(推理与调用工具交替进行的智能体框架)五次运行的平均成功率 Mean@5 是 77.4%,而同一任务五次全部成功的比例 Pass^5 只有 53.0%,相差 24.4 个百分点,作者称之为 consistency gap,难任务上这一差距到 30 点。机制是每一步决策都从下一个 token 的概率分布里抽:分布峰越尖,GPU 浮点非结合性、请求批处理这类扰动越改不动结果;峰越平,几个概率接近的候选会被扰动重新排序,而一条轨迹串起几十步,单步翻车的小概率会累积成大差距。Consistency Analyzer 只取一条已录轨迹、不需要标准答案,对每个决策点重采样 k=5 次,定位易翻车的那几步,再蒸馏成 consistency guidelines;同一批评测里差距从 24.4 个百分点压到 12.0,同任务 Pass⁵ 升 16.0 个百分点、相似任务升 13.0,平均准确率没有代价。

    • Mean@5 平均成功率77.4%
    • Pass^5 五次全对53.0%
    • 一致性差距24.4 个百分点
    • 加入指南后差距12.0 个百分点
    同一 ReAct 智能体在 AppWorld 上平均成功率与五次全对率的落差

    没写清 材料只给了 k=5、单套基准、单一模型的结果,没写换 k 值、换模型或换基准后差距是否照旧,所以不能替它断定这套指南在别处同样有效。

    下一步 翻 arXiv 上那份技术报告的评测表,确认 Pass⁵ 提升 16.0 个百分点是否在第二套基准上复现。

AI工具

2

  1. AI工具Simon Willison

    Gemini Live 音频
    Gemini Live 强化音频,但适用场景仍限实时语音互动

    要接语音代理的团队,可以把服务端音频中转这一步从排期里删掉,直接在浏览器里连 Gemini 3.8 Live;但它只吃实时语音这一段,与 OpenAI 的 GPT-Live 是同一形态,选型仍得逐项比。

    展开全文

    依据

    Simon Willison 在 15th September 2026 的记录里说,Google 当天发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,两个 speech-to-speech(语音进、语音出,不经文字中转)模型,形态与 OpenAI 的 GPT-Live 家族相似。他把 GPT-6 Astra Extra High 对着文档指过去,让它搭出试用页面:选模型与音色、填可选 system prompt,然后在浏览器里开始语音对话,并且能在模型说话时打断。机制上这个页面不用任何库,直接连 BidiGenerateContent 的 WebSocket(一种保持长连接的双向通信协议)端点,用 Web Audio API 的 AudioContext(浏览器里负责采集与播放音频的接口)同时做采集和播放——省掉的是服务端音频中转,留下的是必须一直挂着的实时会话。他站内标签计数里 websockets 是 21、speech-to-text 也是 21,都远小于 google 的 416 和 llms 的 1,958,这类实时语音条目在他长期跟踪的样本里仍是少数。

    1. 选模型与音色
      选定
    2. 填可选 system prompt
      开始
    3. 浏览器采集音频
      推流
    4. WebSocket 双向流
      随时
    5. 说话中途打断
    浏览器里从选模型到中途打断的语音会话步骤

    没写清 材料没给两个新模型的定价、延迟和语言覆盖,也没说打断之后上下文怎么续,所以不能替它们补上这几项。

    下一步 按他给的那条 BidiGenerateContent WebSocket 端点去查配额与计费页,确认 Extended Thinking 是否单独计费。

  2. AI工具AWS Machine Learning Blog

    使用 Amazon Bedrock 提示缓存优化成本与延迟
    重复上下文才有效,Bedrock缓存最高省九成输入成本,低频调用者收益有限

    这改变的是高频调用团队的开支决定:跑 agent、系统提示很长且每分钟都在重复同一段上下文的,把 prompt caching 打开;一周只调几次的先别改,重复次数不够,省下的输入成本盖不住为缓存多付的那一次。

    展开全文

    依据

    AWS Machine Learning Blog 在《Optimizing cost and latency with Amazon Bedrock prompt caching》里说,把反复出现的前缀放进缓存,能压输入成本也压延迟(latency,就是从发出请求到收到第一个字之间的等待)。省钱只发生在重复的那一段:同一段系统提示、同一份工具说明被一次次重新送进去,命中缓存的部分才按折扣算,策展点评给的上限是最高省九成输入成本。判断对象因此是调用频次,不是模型能力——一个每天被同一段长提示调用上万次的客服 agent,和一个一周只跑几次的脚本,面对同一个九成,前者能把为缓存多付的那一次摊回来,后者摊不回来。低频调用者的收益有限,不是因为缓存无效,而是因为它省钱的那段上下文在账单里本来就不占几行。

    没写清 材料没给缓存写入的单价、最小可缓存 token 数和缓存存活时长,所以替读者算不出低频调用者的回本点。

    下一步 下一步:在 Bedrock 定价页核对缓存读取与写入的每千 token 单价,再按自己每分钟的重复前缀调用量算出回本所需次数。

精选深读

2

  1. 精选深读Google DeepMind

    推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking
    Gemini 3.8 Live主打实时交互,扩展思考版更贵,选型得看延迟预算。

    做语音 agent 的团队现在要定的是分工而不是二选一:主对话链路挂 Gemini 3.8 Live 保实时,把多步推理甩给 Extended Thinking,还是整条链路都用后者。选错的代价不对称——前者延迟预算超支,后者复杂任务答不动。

    展开全文

    依据

    Tom Ouyang(Principal Engineer,首席工程师)和 Malini Jaganathan(Member of Technical Staff,技术团队成员)代表 Gemini Audio Team 发布这两个模型。分工写在定位里:3.8 Live「built for scale and cost efficiency」,即冲着规模和单次成本去的,负责实时对话与视觉 grounding(把摄像头或屏幕里的画面当作对话上下文);3.8 Live Extended Thinking 面向高复杂度任务,靠更多推理步数换答案质量。Google 的摘要说两者都能在后台调工具、跑任务而不打断对话,用户今天起可从 Gemini API、Google Workspace、Gemini app 和 Search 拿到。整篇正文没有出现延迟、单价或并发数字。

    没写清 Extended Thinking 比 Live 贵多少、后台多步推理会晚多久出声,原文一个数字都没给,延迟预算只能自己测。

    下一步 拿同一段多步语音任务在 Gemini API 上分别打 3.8 Live 和 Extended Thinking,记录首次出声延迟与实际账单,再核对 Google 定价页是否更新。

  2. 精选深读Latent Space

    游戏中习得的技能能迁移到现实工作吗?
    同一游戏训练出金融研究增益,说明迁移瓶颈在训练设计而非题材。

    定训练方案的人:与其为金融场景换题材或另买领域数据,不如先把目标工作流原样搬进环境——查数据库、填 Excel、写函数再算答案;同一个 1830 里,只有这么训的那版把增益带到了 Finance-Agent。

    展开全文

    依据

    Good Start Labs 联合创始人兼 CEO Alex Duffy 说,强化学习环境是教模型任何可验证能力最可靠的方式之一。他们拿十九世纪铁路游戏《1830: The Game of Railroads and Robber Barons》训练一个 30B 模型:这游戏唯一靠运气的环节只是决定开局顺序,但内置股票竞拍机制,玩家要竞买铁路公司股票、搭出物流网络。Duffy 描述的做法是把工作流搬进游戏——模型翻数据库找这局怎么打的、写进 Excel、在里面写函数、再据此算答案,跟典型财务流程同构。实验比的是两种训练设计:单轮问答(给一个局面让模型走下一步),和多轮终端智能体(用工具探索环境、规划策略、实时调整)。两种设计都改善了自己在游戏内的目标,但只有终端智能体那一版把成绩带到了 Finance-Agent 这个金融研究基准上。更早的对照来自 Diplomacy:OpenAI 的 o3 靠提前规划背叛赢下所有对局,Claude 的 Opus 4 拒绝说谎,Duffy 说它因此「被打得很惨」。所以他把结论落在 harness(把游戏交给模型的那套脚手架)上:它怎么设计,完全改变模型能学到什么。

    1. 决策智能体
      动作轨迹
    2. 技能库智能体
      改写技能库
    3. 技能库
      回灌下一轮
    4. 下一轮决策
    COS-PLAY 中技能库被改写再回灌下一轮的循环

    没写清 材料只给了方向——只有终端智能体那版在 Finance-Agent 上提升,没给提升幅度,也没给两版在游戏内目标上的具体成绩,因此不能替它判断这个增益有多大。

    下一步 下一步可核对:Good Start Labs 是否公开 Finance-Agent 上两版设计的分数,以及把同一 harness 换到另一款游戏后,是否仍只有终端智能体那版提升。