跳到正文

2026年10月06日AI 版

7 条 · 6 个来源

头版

行业动态Simon Willison

引用 Felix Rieseberg 的话
插件生态隐患被点破,采纳前需权衡治理成本

企业安全团队批准 Cowork 的前提要改写:沙箱从员工笔记本挪到云端后,本地文件只在桌面端那次工具调用时开口,审批对象从整台 VM 缩成这一条调用路径。

展开全文

依据

Felix Rieseberg(Anthropic)说,旧版 Cowork 把模型推理放在云端,工具调用跑在一台 Anthropic 下发到用户电脑的 VM(虚拟机,本机隔离的运行环境)里,加这台 VM 是为了能力、安全与隔离,只映射用户明确加进会话的数据;用户不满的是本机 VM 占磁盘、耗电、拖慢性能,以及合上笔记本就停工。新版把模型推理和 VM 都放进云端,每个会话一个独立沙箱、彼此不共享状态;VM 需要用户设备上的文件时,由桌面应用负责那次文件访问工具调用。机制上的位移是:隔离边界从「员工设备上的 VM」改成「云端按会话沙箱」,而被挪出去的本地文件访问,重新变成一条需要单独审计的接口。

  1. 云端模型推理
    下发工具调用
  2. 按会话独立沙箱
    需本地文件
  3. 桌面端代取文件
新版 Cowork 把推理与沙箱移到云端,只把本地文件访问留给桌面端。

没写清 材料没说桌面端那次文件访问调用的权限粒度、日志留存,也没说旧版本地 VM 何时停止支持。

下一步 核对 Anthropic 那份 help page 是否公布桌面端文件访问的权限范围与旧版 Cowork 的停用时间。

行业动态

3 条

  1. 围绕 AI 接管数学界的所有风波

    行业动态The Verge AI

    围绕 AI 接管数学界的所有风波
    OpenAI等实验室宣称解决千禧年难题,数学家却要证据,突破与争议并存。

    数学家在决定是否把 OpenAI 的千禧年难题声明当作可引用成果前,应先要求公开证明与训练数据来源;期刊和会议评审也需把未发布模型的推导标为不可复现,不能只凭实验室新闻稿授信。

    展开全文

    依据

    《The Verge》的 Robert Hart 报道,OpenAI 在过去一年宣布了多项长期数学问题的突破,并称其中一个涉及千禧年难题(Millennium Prize problems,著名的长期数学难题);但数学家对 OpenAI 的数据来源与证明提出质疑。OpenAI 随后成立独立数学家小组,想借外部咨询修复关系,一名小组成员也向 The Verge 形容过程混乱、令人困惑。机制在于:实验室用未发布模型产出结果,先发新闻再补证明,数学界无法复现或确认数据是否来自被质疑者的作品;同时小组被交办的首项任务,是帮助协调发布 OpenAI 所称未发布模型产出的更多结果。

    1. OpenAI
      宣布咨询
    2. 独立数学家小组
      首项任务
    3. 协调结果发布
    OpenAI 先成立外部数学家小组,再让小组协调未发布模型结果的发布。

    没写清 OpenAI 未发布模型具体解决了哪一个千禧年难题、证明是否经同行评议、训练数据是否含质疑者作品,材料都没给。

    下一步 看 OpenAI 是否公开该独立数学家小组的成员名单、职权范围,以及那批未发布模型结果的证明与数据来源。

  2. 行业动态MIT Technology Review AI

    将 AI Agent 连接到企业知识
    企业AI代理缺的不是数据,而是组织语境,知识工程才是落地门槛

    把预算和验收口径从模型层挪到语境层的决定,该由首席数据官牵头拍板:代理只跑到试点时,先按语义知识、情景记忆、流程知识三项分别验收,再谈扩规模。

    展开全文

    依据

    MIT Technology Review Insights 与 Neo4j 联合调研了 300 位数据、AI 及其他技术高管,结论是代理缺的是知识而非数据——知识指数据在本组织语境里意味着什么。机制很清楚:代理没有这层理解,就会在推理和行动上出错,于是试点做不完。对照数字是:平均只有 34% 的代理项目进入生产,而生产领先者(平均 61% 的项目越过试点)在语义能力上明显更强,两者同步。障碍分布也分开了:55% 的人把数据碎片化(系统之间数据共享不足)列为扩大代理知识获取的首要难题;领先者更把安全与隐私当主要顾虑,这一组占 72%。投入方向集中在检索技术,包括摄取管道、AI-ready API 和 RAG(检索增强生成,先检索再交给模型生成),以及评估代理和知识图谱。

    • 代理项目进入生产(整体平均)34%
    • 代理项目进入生产(生产领先者)61%
    • 把数据碎片化列为扩大知识获取的首要难题55%
    • 生产领先者把安全与隐私列为主要顾虑72%
    同一份 300 位高管调研中,生产领先者与整体在两处关键指标上的差距。

    没写清 材料没给建设知识层所需的成本、周期和人力,也没拆出 34% 里有多少失败源于数据本身、多少源于语境缺失。

    下一步 核对这份报告对语义知识、情景记忆、流程知识分别给出的验收指标定义,看能否直接拿来当验收清单。

  3. 行业动态OpenAI

    我们在欧盟文本来源规则上的做法
    OpenAI水印检测仅限研究者,企业自证来源仍需另建机制

    采购和合规负责人在签模型服务合同时,要把「AI文本来源凭证由谁出具」写进条款:OpenAI 的检测口只开给研究者,供应侧没有可依赖的出厂证明。

    展开全文

    依据

    OpenAI 在说明自己如何应对欧盟文本溯源(provenance,即一段文本从哪来、经过谁的链路)规则时,只交代了三件事:水印(watermarking,在生成文本里嵌入可被检测的标记)在哪些地方适用、检测如何运作、以及为什么访问权先从研究者(researchers)开始。按这个说法,检测能力不随模型一起交付:企业能拿到生成结果,拿不到读出验证结果的那一端。机制上水印要成立得两头发力——生成端嵌入、检测端读出;材料把检测端先给了研究者,企业侧的核验就成了空缺。三条信息里没有一条划出适用范围的具体边界。

    没写清 材料没写水印的适用边界——哪些模型、哪类输出、是否只覆盖欧盟用户,这层不能替它补。

    下一步 核对 OpenAI 的 EU 溯源说明页是否新增面向企业或开发者的检测申请入口。

AI工具

2 条

  1. 命令行工具可快速从 macOS 27 中移除 Apple Intelligence

    AI工具Ars Technica AI

    命令行工具可快速从 macOS 27 中移除 Apple Intelligence
    能腾出12GB以上空间,代价是苹果智能功能随之不可用。

    对买了小容量 Mac 的 macOS 27 用户,这改变的是「忍着模型占盘」还是「装第三方脚本换回开关」这道取舍:Om Lahore 的 RemoveMacAI 让关闭 Apple Intelligence 重新变成一条命令,代价是 Siri、写作工具、Genmoji 与摘要一并停用。

    展开全文

    依据

    Ars Technica 的 Scharon Harding 报道,GitHub 用户 Om Lahore 上周发布命令行工具 RemoveMacAI,声称可在 macOS 27 上「完全可逆」地关掉 Apple Intelligence(苹果的端侧 AI 功能集合)。机制是绕开系统文件:你在系统设置里批准一个配置描述文件,它再借苹果自己的资源服务(asset service)阻止系统继续下载模型,因此系统完整性保护(System Integrity Protection,防止 /System 被改写的保护机制)保持开启,/System 不被直接触碰;执行 removemacai revert 撤掉描述文件,重新打开某项功能时 macOS 会再下载模型,也可以只删不想要的那几项。对照数字:开发者称模型约占 12GB,The Verge 指出实际可超过 30GB;截至发稿仓库在 GitHub 有 1,700 颗星,Reddit 上有用户报告工具生效。被关掉的是 Siri、写作工具、Genmoji、Image Playground、ChatGPT 扩展和各类摘要,听写属独立设置仍可用。

    • 开发者称模型占用约 12GB
    • The Verge 指出的上限超过 30GB
    • GitHub 星标1,700 颗
    RemoveMacAI 材料里可对照的三个数字:模型占用的下限与上限、仓库星标数。

    没写清 材料没有 RemoveMacAI 在任何具体机型上的实测释放容量,也没有关闭后对电池、响应速度的影响数据,所以「超过 12GB」只是开发者与媒体说法,不能替每台机器兑现。

    下一步 可核对的一步:盯 macOS 27 后续小版本更新后这些模型是否被重新下载,以及苹果是否在系统设置里恢复关闭开关。

  2. AI工具AWS Machine Learning Blog

    用 Claude Code 和 Amazon Bedrock 大幅提升受监管工作负载
    政企与ITAR场景可用,但模型锁定Bedrock,迁移成本需先算清。

    让受监管项目里管开发平台选型的人,把 FedRAMP Class D 与 DoD IL4/IL5 当成准入门槛而非采购理由:先确认自己的合规边界落在这套授权覆盖范围内,再决定是否放 Claude Code 进受监管代码库。

    展开全文

    依据

    AWS 博客作者 Bradley Wyman、Doug Hairfield、Keith Martin 在 2026年10月5日发文称,Claude Opus 5.5 与 Claude Sonnet 5.5 已在 AWS GovCloud (US) 上线,Claude Code 是 Anthropic 的 agentic coding tool(智能体编码工具,可自主读写代码库并执行多步开发任务)。机制在于资质不是挂在模型上,而是挂在组合上:Claude Sonnet 5 持有 FedRAMP Class D(原 High)认证与 DoD Impact Level 4 和 5(IL4/IL5)授权,而 Opus 5.5 与 Sonnet 5.5 的 FedRAMP Class D 是在 Amazon Bedrock 上成立的。ITAR(International Traffic in Arms Regulations,国际武器贸易条例)场景要用的就是「模型+Bedrock+GovCloud」这一层,把 Bedrock 换掉,合规依据就不再是原文说的那一条。

    没写清 材料没有给出迁到 Bedrock 与 GovCloud 的工期、费用,也没有 Claude Code 的计价方式,因此无法判断迁移成本落在什么量级。

    下一步 核验 AWS 页面上的当前模型认证状态(原文即注明 verify current model certification status),确认 Opus 5.5 与 Sonnet 5.5 的 FedRAMP Class D 与 IL4/IL5 是否覆盖你所在区域与工作负载。

精选深读

1 条

  1. 在 Amazon Bedrock 上推出 GLM 5.3

    精选深读AWS Machine Learning Blog

    在 Amazon Bedrock 上推出 GLM 5.3
    753B参数MoE在Bedrock上线,编码与长任务团队可先试,别忘了成本账。

    正在为开源权重编码模型自建推理集群的团队,可以把「先自建还是先托管」这一步往后推:GLM 5.3 在 Amazon Bedrock 上以托管 API 提供,可以先用它验证编码与长周期任务能不能跑通,再决定是否自己搭推理基础设施。

    展开全文

    依据

    AWS 博客作者 Alex Thewsey 在公告里说 GLM 5.3 已可在 Amazon Bedrock 上调用,并写明 Z.ai(智谱 AI)报告该模型表现出显著的网络安全能力。它是 753B 参数的混合专家模型(mixture-of-experts,MoE:推理时只激活部分专家而非全部参数),定位编码和长周期 agentic(智能体)任务。托管这件事改变了分工:团队不再需要采购和运维自己的推理基础设施,而是走带跨区域推理、提示缓存(prompt caching:复用重复前缀以降低成本和延迟)和服务层级的托管 API,并用 OpenAI 兼容接口接入。公告同时写明,访问权限只对 eligible enterprise customers 开放。

    1. 企业客户准入
      接入
    2. OpenAI 兼容接口调用
      复用前缀
    3. 提示缓存压成本
      实测
    4. 授权安全测试
    从企业准入到在 Bedrock 上跑授权安全测试的工作顺序。

    没写清 材料只说面向 eligible enterprise customers,没给准入标准、单价和限流,所以成本账无法替它算。

    下一步 先在自己的 Bedrock 账号上确认是否落在 eligible enterprise customers 的准入范围内。