跳到正文

2026年09月14日AI 版

7 条 · 5 个来源

头版

行业动态OpenAI

Perplexity 信任 GPT-6 Astra 处理端到端系统
Perplexity把生产系统交给Astra,人工检查频次明显降低,风险自担

Perplexity团队把生产系统交给GPT-6 Astra并降低人工检查频次,这个决定要由他们自己承担:用回滚、告警和审计记录接住模型误判,否则效率收益会转成线上故障成本。

展开全文

依据

原文称,Perplexity 把 GPT-6 Astra 用于撰写对外沟通内容、修改软件和监控生产系统;相比早期模型,团队对 Astra 的检查频次“明显降低”。机制在于:检查频次降低,模型在修改软件和监控生产系统时获得更高自主权,人工拦截错误的机会同步变少;一旦误判,代价落到线上服务。因此这套信任适合有成熟回滚、告警和审计机制的团队;缺少兜底能力却照搬降低复核频率,等于把误判的处置成本留给值班工程师。

没写清 材料没有给出检查频次降低的具体幅度、覆盖哪类变更,也没有误判率或生产事故数;所以无法替它判断风险是否已被回滚机制覆盖。

下一步 下一步可核对 Perplexity 是否披露 Astra 误判导致的生产事故数,以及修改软件、监控生产系统这两类操作的审计与回滚记录。

行业动态

4

  1. 行业动态The Verge AI

    Trump 和 Mike Johnson 认为 AI 行业反应过度
    特朗普怕暂停让中国反超,但安全派警告的竞赛风险同样真实。

    把「放慢前沿」当成行业共识来排风险预案的团队,得改按「政治已否决暂停、立法尚未落地」这一分裂现实重排优先级。

    展开全文

    依据

    Anthropic的Dario Amodei发公开信呼吁放慢前沿模型开发,OpenAI的Sam Altman、xAI的Elon Musk和DeepMind的Demis Hassabis都对此表态支持;特朗普对《金融时报》说「谁赢AI谁赢」,众议院议长约翰逊在CNN称国会紧急监管会是「国家安全威胁」。机制是这样的:头部实验室想以自愿放缓换取政策空间,而政治层面把任何监管都读成对华竞赛中的让步,于是否决发生在立法之前,安全评估、算力与数据治理的推进节奏先被压住。另一层对照是,这些表态都不是法律文本,实际约束仍取决于国会与行政规则,所以「被否决」和「被禁止」不是一回事。

    1. Amodei呼吁放慢开发
      跟牌
    2. 头部CEO表态支持
      被否决
    3. 特朗普约翰逊反对
      未落地
    4. 约束待国会立法
    从公开信到政治否决:头部CEO的放慢提议在政治层面被挡下,约束回到国会。

    没写清 材料没有列出任何一项具体监管条款、立法编号或时间表,所以无法判断被压住的窗口究竟是哪几条规则、会持续多久。

    下一步 下一步核对国会下一个会期是否把前沿模型的安全评估或算力条款排入议程。

  2. 行业动态Wired AI

    AI Agent 对算力如饥似渴
    智能体密集算力需求正推动数据中心扩建,但能源代价谁来承担

    这改变的是为数据中心扩建立项、选址和供电签字的公用事业与地方监管者:他们不能再拿聊天机器人单次查询当负荷依据,而要按智能体任务的多轮自提示和并行助手披露能耗,否则新增电费会先摊到本地用户头上。

    展开全文

    依据

    WIRED 的 Maxwell Zeff 说,agent(智能体,材料定义为基于大语言模型、可自主决策执行任务的系统)不是一问一答,而是根据用户原问题给自己几百个小提示;例如让它建网站,可能跑数小时,过程中自我重提示几十次。Boris Gamazaychikov 说这使算力与用户数量解耦,AI 领袖谈的是一人公司背后有几百上千个智能体。机制上,单个查询变成多轮提示和并行助手,任务越复杂,功耗上限越不封顶;OpenAI 称 10,000 个以上智能体发送 2.7 million 条消息解出一道数学题,数学家反驳其说法,但消息本身耗掉大量算力。Sam Altman 曾称收一颗杏仁的水等于 38,000 次 ChatGPT(OpenAI 的聊天机器人)查询,该算法有争议;Zeke Hausfather 算自己日均 Claude(Anthropic 的对话模型)会话可能耗电超过两台冰箱,Sustainable AI Group(可持续 AI 研究咨询组织)说其依据偏旧并将在本月晚些时候发更精确测算。

    • OpenAI 数学题智能体群10,000 个以上
    • 群发消息量2.7 million 条
    • 单颗杏仁水耗等价38,000 次 ChatGPT 查询
    材料中可对照的数量级:智能体群规模、消息量和单颗杏仁水耗等价值。

    没写清 材料没给出智能体单次任务的瓦时、兆瓦或电价数字,也没说这些电费和碳排具体由哪一方承担,所以不能替它算总账或指定责任人。

    下一步 等 Sustainable AI Group 在本月晚些时候发布封闭模型上智能体环境足迹的更精确测算后,核对它是否给出瓦时、用水量或等效家庭用电口径。

  3. 行业动态The Verge AI

    OpenAI 只想赢
    OpenAI拿下千禧年难题,数学家却担心资源碾压破坏协作规范。

    和实验室抢同一道题的数学家,得在动手前决定要不要公开提示、算力和数据来源,否则事后只剩两边各说各话。

    展开全文

    依据

    OpenAI称动用约一万个智能体、数千万美元算力、88小时解出纳维-斯托克斯问题,并发现自己在和NYU教授Buckmaster、以及对手机构的Alpöge赛跑。公司说Buckmaster通过Codex提交的提示不可能影响系统或训练,Buckmaster表示难以采信。争议集中在训练数据来源、贡献认定,以及保密能不能被核验。

    没写清 材料没有独立复核,这些质疑还不能被当成已经坐实的学术不端。

    下一步 先看训练数据和贡献认定有没有可核验的公开记录,再决定要不要把这次结果写进合作。

  4. 行业动态Simon Willison

    引用 huggingface.co/security.txt
    AI公司把安全披露写进文件,漏洞报告路径透明,但防护仍靠自觉。

    在 security.txt 里挂漏洞入口的安全负责人,现在要单独决定那段给 AI 代理看的话怎么写、由谁审:它是一句劝退,不等于受理承诺。

    展开全文

    依据

    Simon Willison 在 9月11日 摘录了 huggingface.co/security.txt 里的一段话:如果 AI 代理是被指派来找漏洞的,CyberGym benchmark(benchmark 指评测基准,材料只说明它在 GitHub 上公开、可以去刷高分)就在那里,不必入侵 Hugging Face,顺便把模型权重也传到 Hugging Face 上。security.txt 是放在网站根目录、给机器读的漏洞报告与联系方式约定文件,浏览器用户看不到,但被指定目标的代理会去抓它,所以这段话实际是插在披露管道里的劝退指令。它的效果完全依赖对方读完照做,既不缩小可达面,也没有留联系邮箱或响应时限。同一博客的标签计数可作为存量对照:security 638、ai-security-research 42、hugging-face 27、accidental-cyberattacks 16、openai-hugging-face-incident 9。

    没写清 材料没说这句话是否真的让任何代理掉头,也没有 CyberGym 上是否存在从这条路径过去的记录。

    下一步 核对 huggingface.co/security.txt 的后续版本有没有补上联系邮箱或响应时限。

AI工具

2

  1. AI工具Simon Willison

    用 GPT-6 Astra 和 ChatGPT Work 生成跑步路线
    GPT-6 Astra生成跑步路线看着新,但无内容细节,价值难判。

    验收 agent 地理任务的人,别只收 GPX 和地图:得在会话被压缩前把跑过的代码单独留档,否则你手上有条 5.1 公里的环线,却说不出它是怎么算出来的。

    展开全文

    依据

    Simon Willison 说他让 ChatGPT Work 里的 GPT-6 Astra(Max)生成从自家出发的 5K 和 10K 环线,跑了 27 分钟,交付内嵌地图加可下载的 GPX(GPS 轨迹文件)和 GeoJSON(地理矢量数据)。他追问方法,模型答:用 Nominatim(OpenStreetMap 的地址地理编码服务)定位住址,用 Overpass(OSM 查询接口)拉取本地道路与步道,再本地算环线;地图由 visualize 技能渲染,写出 /workspace/el-granada-5k-share.html,几何塞在页面内的 JSON 块里,D3 从 CSP 白名单中的 CDN 加载。他真正踩到的是流程不可见:等他想要那段 Python,会话已被压缩(compaction,把长上下文压成摘要省 token),拿不回来。所以他主张凡用压缩的系统都要保留压缩前文本,并让 agent 通过工具调用取回。另外内嵌 HTML 里那条 5K 路线标题是 El Granada harbor loop,距离标的是 5.1 km——文件能下载,但名字和里程之间没有任何核对环节。

    1. 用 Nominatim 定位住址
      地址转坐标
    2. 用 Overpass 取 OSM 道路
      路网数据
    3. 本地计算环线
      环线几何
    4. visualize 技能渲染地图
      页面与文件
    5. 导出 GPX 与 GeoJSON
    GPT-6 Astra 生成跑步路线的五步:从地址定位到导出 GPX。

    没写清 材料没说 10K 路线是否也生成成功,也没给任何路线可跑性、安全性或里程准确度的验证,这块不能替它补。

    下一步 下一步可核对:Simon 是否在后续文章里贴出那段 Python,或 ChatGPT 能否在压缩后通过工具调用把代码取回。

  2. AI工具AWS Machine Learning Blog

    使用 Amazon Bedrock AgentCore 构建交互式 MCP Apps
    想一次开发多处运行MCP应用,AgentCore这套方案省去适配成本

    让准备把 MCP(Model Context Protocol,模型上下文协议)应用铺到多个运行环境的平台团队,先决定是否用 Amazon Bedrock AgentCore 换掉自建适配层;省下的是每处重写的工,押上的是运行时和权限边界更依赖 AWS 托管。

    展开全文

    依据

    AWS Machine Learning Blog 在标题中提出“Build interactive MCP Apps using Amazon Bedrock AgentCore”。MCP 是 Model Context Protocol(模型上下文协议),作用是为代理调用外部工具或数据提供统一接口;AgentCore 被 AWS 定位为构建、连接和优化代理的平台。机制上的取舍是:开发者写一次 MCP 应用,由 AgentCore 承担连接、托管或运行适配,于是少写针对不同环境的胶水层;代价是运行时位置、鉴权链路和排障入口更依赖 AWS,离开这套托管边界的路径没有被材料证明存在。

    没写清 材料没有给出 AgentCore 对 MCP 应用的具体运行目标、鉴权模型和计价,因此无法判断省下的适配成本能否覆盖迁移与锁定代价。

    下一步 下一步核对 AWS 官方 AgentCore 文档是否列出 MCP Apps 的部署目标清单、鉴权方式,以及是否支持非 AWS 运行时。