跳到正文

2026年10月03日AI 版

9 条 · 6 个来源

头版

Apple 将限制 Mac 磁盘访问,因 AI Agent 风险“大幅”增加

行业动态The Verge AI

Apple 将限制 Mac 磁盘访问,因 AI Agent 风险“大幅”增加
Apple收紧Mac全盘访问,源于AI Agent风险;普通用户需多一步确认

Apple 把全盘访问的授权成本压到备份类 App 的首次引导上:新用户得走一遍系统层的显式操作,首次授权的转化损失由开发者买单,而 Agent 本身的自主范围并没有被限流。

展开全文

依据

Apple 在周五的更新中说,部分开发者使用全盘访问的方式可能把用户置于风险中,并称 AI agent(能自行规划并执行任务的智能体)越自主,这一级权限的风险就越大,因此只有「非常明确的用户操作」(very explicit user action)才应授予。这里说的全盘访问(full disk access)是 macOS 上一项让应用读取整个系统的权限,Apple 自己承认它「大体绕开」了面向用户的隐私控制,当初是为了让备份应用能正常工作。触发点是 Inc 的 Jason Aten 发现 Meta 的 Muse 在他未明确授权的情况下知道了他消息的内容;Meta 发言人 Andy Stone 反驳称消息访问是「完全可选项」,且必须同时开启全盘访问和 Messages 连接器。Apple 未公布推送时间,也未回应 The Verge 的置评请求。对照来看:内部把这条权限定性为「extraordinary level of access」,却把它存在的理由归给备份这一窄场景,中间被牺牲的是备份应用的新用户引导,而不是被点名的 Agent 能力。

没写清 材料没说已获授权的存量应用是否要重新确认,也没说这次更新何时推送、落在哪个 macOS 版本上。

下一步 等 Apple 放出该控制的开发者文档或 beta 版本号后,核对它是否要求已授权应用重新走一次确认。

行业动态

3 条

  1. 这些 AI 专家想要公开进行高风险研究

    行业动态Wired AI

    这些 AI 专家想要公开进行高风险研究
    想撬开前沿实验室的闭门研究,但公开高风险课题的代价也不小

    这件事改变AI研究者和资助方的下注对象:原先只能等OpenAI、Anthropic开放模型细节,现在要判断是否支持Trillium Labs把后训练和递归自我改进放到公开实验里;公开后外部能复现挑错,高风险方法也会更容易被看见和模仿。

    展开全文

    依据

    Nathan Lambert 与 Tom Zick 创办非营利机构 Trillium Labs;WIRED 10月2日报道其当天启动。两人说要把实验细节公开,让外部科学家能研究和复现,而不是像 OpenAI、Anthropic 那样只让强模型通过应用或应用程序接口(API)被访问。机制是:后训练(模型建成后的微调)和递归自我改进(RSI,让 AI 参与研究来开发新模型)需要大量算力与反复试验,闭门做挡住外部复核;公开做则把可复现性变成外部挑错入口。材料里的对照是,小米公布了某次大模型训练的运行细节,斯坦福研究者正在公开预训练 Marin;Trillium Labs 还会看强化学习(用奖励好结果、惩罚坏结果来改进模型)如何塑造模型性格。它已从 Schmidt Sciences、Halcyon Futures 等拿到未披露金额,目标是总共筹集 $40 to $100 million,并计划在未来18个月花 $30 million 在训练上。

    • 筹款目标$40 to $100 million
    • 训练支出$30 million
    • 执行窗口18个月
    Trillium Labs 的筹款目标、训练支出与执行窗口。

    没写清 材料没说公开到什么粒度:是论文、训练日志,还是代码与权重,也没说谁有资格做 RSI 这类高风险实验。

    下一步 核对 Trillium Labs 是否在18个月内执行 $30 million 训练预算,并发布首份后训练或 RSI 实验的公开记录。

  2. 行业动态MIT Technology Review AI

    用自主 AI 重新定义企业智能
    预算涨得比组织消化能力快,钱多不等于落地稳。

    企业CIO和AI平台负责人应把2026年的下一轮AI预算决策从采购更多模型与算力,改为先重做流程和数据就绪度;否则44%的投入增幅会继续堆进销售、客服、财务各自的数据孤岛。

    展开全文

    依据

    MIT Technology Review Insights 在与 Uniphore 合作的报告里称,全球 AI 投资将在 2026 年达到 $2.5 trillion,较上一年增长 44%;同一材料又说,模型能力推进快于多数组织整合能力。机制是:钱先变成各职能各自采购的模型和工具,销售不知道未结客服工单、营销看不到财务已知的客户信息,智能便停在孤岛里。报告把解法写成 agentic shift(智能体化转型):先做流程重设计,再选模型;先让数据可被 AI 使用,而不是先囤数据量;用 sovereign、composable foundation(主权且可组合的基础层)在原地查询和准备数据,不迁移、不集中化。它点名 process-first(流程优先)公司把流程重设计放在模型选择之前,因而拿到持续回报;多数企业仍没有靠 AI 增长收入,也没重做运营方式。对照数字就是 $2.5 trillion 和 44%:预算涨得比组织消化能力快。

    • 2026年全球AI投资$2.5 trillion
    • 同比增幅44%
    材料给出的AI投资规模与同比增幅

    没写清 材料没有说明 $2.5 trillion 里有多少流向流程重设计与数据就绪度,也没有给出 process-first 企业的收入增长幅度。

    下一步 下一步核对 Uniphore 报告原文是否披露样本量、行业分布,以及 process-first 公司的收入增长口径。

  3. 行业动态AWS Machine Learning Blog

    在 Amazon SageMaker AI 上用多轮 RL 微调搜索 Agent
    小搜索Agent用多轮RL微调后,检索质量与可靠性提升。

    如果团队曾因小模型多轮检索不稳而改用前沿模型,这条把采购/技术选型改成:在 Amazon SageMaker AI 上用多轮强化学习微调小模型,把工具与环境知识教进模型,再决定是否还用前沿模型兜底。

    展开全文

    依据

    AWS Machine Learning Blog 的 Huibin Shen、Pooja Karadgi、Sifei Li 和 Lorenzo Stella 在 2026年10月2日 的文章里说,搜索 Agent 要在多轮交互中自主决定搜什么、用哪条检索策略、何时停止,并根据已检索内容调整下一轮。机制难点是基础模型不预先知道你的工具和环境:提示小模型,多轮行为很少可靠;提示前沿模型,往往可用,但延迟和成本更高。作者给出的第三条路是微调,把工具和环境直接教给小模型,目标是小模型的速度与成本,加上原本要靠前沿模型才有的可靠性;标题中的 multi-turn RL(多轮强化学习,reinforcement learning)就是这条微调路径。文中还提到传统 SFT(监督微调,supervised fine-tuning)依赖专家演示。

    1. 用户提问
      接收任务
    2. 决定搜什么
      发起检索
    3. 选检索策略
      返回内容
    4. 读取检索结果
      判断是否继续
    5. 决定停止或继续
    搜索Agent在多轮交互中的循环:先决定搜什么、再选检索策略,读结果后决定停止或继续。

    没写清 材料没有给出多轮强化学习微调前后的检索准确率、延迟或成本对照数字,无法判断相对前沿模型省了多少。

    下一步 下一步核对 AWS 博文后续是否公开训练脚本、评测数据集,以及 SFT 与多轮 RL 的对照结果。

AI工具

3 条

  1. Meta 开源代码,让你制作 Muse AI 设备

    AI工具The Verge AI

    Meta 开源代码,让你制作 Muse AI 设备
    Meta开源Muse让DIY硬件门槛降低,但玩法仍受SDK与ESP32限制

    这条把选型决定交回硬件创客手里:Muse 的接入点从 Meta 自家整机挪到工作台上的 ESP32 和树莓派,先做原型的人不必等官方出货。代价也跟着转移,Meta 的原话是后果自负,接错线或调用超限没人替你兜。

    展开全文

    依据

    Meta Superintelligence Labs 的 Nat Friedman 给出的数字是:Muse Home Link 这台官方小盒子只做了 5,000 台,想要的人现在排队,本月开始发货。The Verge 的 Jay Peters 报道同一批放出来的是代码——用 Meta 的 SDK(软件开发工具包,一套让程序调用 Muse 的接口),配一块现成的 ESP32 板或树莓派,再把显示、按钮、传感器、执行器接上去。Meta 举的例子是彩色电子墨水屏看提醒、HDMI 棒把画面投到大屏、小触摸屏拼出一台像 Muse Charm 的设备,并提醒后果自负。门槛确实低了,ESP32 和树莓派都是能直接下单的板子,不用等 Meta 出货;但对话能力仍要过 Meta 的 SDK 这一层,所以真正被放开的只是接入的外壳,不是模型本身。

    • Muse Home Link 制作量5,000 台
    Meta 官方 Muse Home Link 只做了 5,000 台,剩下的靠自备板子。

    没写清 材料没说 SDK 的授权条款、断网离线时 Muse 还剩多少能力,也没说这 5,000 台之后是否继续生产。

    下一步 本月 Muse Home Link 开始发货后,看 Meta 是否公开 SDK 的调用上限或官方支持的硬件清单。

  2. AI工具AWS Machine Learning Blog

    使用 Amazon Quick 和 Adjudicated Query 模式对数千份租约进行合规扫描
    亚马逊官方披露Quick配规则引擎扫租约,可复现的合规链路,成本是依赖MCP部署

    合规负责人要做的决定变了:不再是抽查多少份租约,而是是否把通过与否的判定权交给确定性规则引擎、由业务在 Amazon Quick 里提问,并一并接下随之而来的部署与运维。

    展开全文

    依据

    AWS 的 Anand Komandooru 在官方博客里把这套做法命名为 Adjudicated Query(裁定式查询):业务用户在 Amazon Quick(AWS 的 AI 助手)聊天界面里直接问合规问题,而通过与否的判定留在确定性规则引擎里,也就是不交给模型的固定规则判断。文中给出的场景是一个组合运营方持有 50,000 份租约、分布在多个州,各州自行发布房东租客法规(滞纳金上限、通知期、押金等);把几万份租约逐条对照这些法规、还要证明真的都核过,已超出多数合规团队的能力范围。作者同时给出 AWS 参考架构和一个可端到端运行的样例,并说明同一模式可移植到制裁筛查、保险理赔裁定、出口管制。

    1. 业务在聊天界面提问
      转译
    2. 裁定式查询模式
      判定
    3. 确定性规则引擎判定
    从业务提问到规则引擎出判定的三步链路

    没写清 材料没有给出跑完 50,000 份租约全量核查的耗时、判定准确率,也没有规则引擎判错时人工复核环节的描述。

    下一步 下一步可核对:把官方样例接到一小批真实租约上端到端跑通,看通过与否的判定能否逐条回溯到具体规则。

  3. AI工具AWS Machine Learning Blog

    用 Amazon Bedrock AgentCore 为 Claude Desktop 添加安全的 Web Search
    接Web搜索得先过IAM和Cognito双认证,安全提了但配置成本也上去了

    已经在 Amazon Bedrock 上跑 Claude Desktop 的团队,这次要改的是检索入口的选型:把自建的外部搜索 API 换成 AgentCore Gateway 的 Web Search 目标,代价是认证链要按 IAM 与 Cognito 重走一遍。

    展开全文

    依据

    AWS 的 Jishnu Dasgupta 在 2026年10月2日的 Amazon Bedrock 博客里给了做法:Claude Desktop 只能答模型训练截止前的内容,查不到最新文档、实时价格或天气;把 AgentCore Gateway(Amazon Bedrock AgentCore 里用来接外部能力的网关)的 Web Search 目标打开,再用托管 MCP 服务器(Model Context Protocol,模型调用外部工具时约定的协议)把 Claude Desktop 接上去,模型就能自己搜。材料给的机制是流量不外泄:Web Search 由亚马逊自家网页索引支撑,索引规模写作 tens of billions 文档,查询流量留在 AWS 基础设施内,不需要自管外部 API key。帖子没有给出任何可对照的延迟、调用成本或检索命中率数字,所以省下多少运维工时无法量化。策展侧另加了一条原文未出现的实现前提:接 Web 搜索要先过 IAM 与 Cognito 双认证,安全边界更清楚,但开通前的权限配置本身也是一笔投入。

    1. Claude Desktop
      发起调用
    2. 托管 MCP 服务器
      连接网关
    3. AgentCore Gateway
      启用目标
    4. Web Search 目标
    Claude Desktop 接 Web Search 的链路:托管 MCP 服务器 → AgentCore Gateway → Web Search 目标

    没写清 原文在「walk through the steps」处截断,IAM 与 Cognito 双认证的具体权限配置、托管 MCP 服务器的开通代价都没写,不能替它补。

    下一步 在 AWS 控制台查 AgentCore Gateway 的 Web Search 目标在你所在区域是否已上线、是否额外计费。

精选深读

2 条

  1. 精选深读OpenAI

    GPT-6 系列模型指南
    初创选GPT-6别只比参数,推理开销和工具编排才卡投产。

    初创的选型会不该以参数排名收尾:先把默认推理档位和必须跑通的工具边界定死,再在能跑完整条链路的型号里挑最省的——代价是可能要放弃单点分数更高、但多步调用容易中断的那款。

    展开全文

    依据

    OpenAI 在《A model guide for the GPT-6 family》里说,这份指南面向初创,覆盖五件事:从 GPT-6 家族里选型号、调 reasoning effort(推理档位,即模型作答前允许花掉的推理预算)、改 prompt 与 skills(技能,即预先挂给模型的固定能力)、编排 tools(工具调用链路)、为生产准备流程。机制上档位与工具编排互相挤压:档位调高,多步工具调用更可能走完,代价是延迟和单次开销上升;档位压低,账面好看,链路却更容易卡在中间某一步。因此型号不是第一顺位变量,默认档位和工具边界才是——先锁这两样,剩下的才轮到比型号。材料通篇没有数字,排不出谁快谁贵。

    没写清 材料没说默认推理档位是哪一档,也没给单次调用的延迟、成本与工具链路完成率,型号之间的先后次序无法在这里排定。

    下一步 等 OpenAI 公布各推理档位的延迟与成本表后,用同一条工具链路在默认档位下复跑,记录第一个失败的调用步。

  2. 精选深读Hugging Face

    开源 AstaBrief,Asta 中的快速报告生成模型
    AstaBrief开源后生成快,但事实一致性得自己兜底。

    这个开源决定改变的是手里有敏感或未发表数据的研究机构:过去只能把稿件交给托管式闭源模型,现在可以下载 AstaBrief 8B 权重在自己机器上生成带引用报告,代价是引用是否忠实原文要由自己校验。

    展开全文

    依据

    Ai2 的 Kyle Wiggers 在 Hugging Face 发文说明:AstaBrief 8B 以 Qwen3-8B 为起点,只做后训练,团队放弃了 RL(reinforcement learning,强化学习)路线,改用 SFT(supervised fine-tuning,监督微调)加 DPO(direct preference optimization,直接偏好优化),理由是 RL 训练不稳定且昂贵。机制上的关键改动是把报告生成管线改成一次性写完,而不是逐节生成,所以论文报告质量被压在训练数据的筛选上。效果对照来自同一套 Asta 完整流程:Fast 模式平均每篇报告 51.1 秒,Thinking 模式 178.5 秒,约 3.5× 的差距。文章自己标注,训练和评测大多在 2025 年完成,所用闭源模型是当时的前沿水平,且未对今天的前沿模型重跑全套评测。

    • Fast 模式(AstaBrief 8B)51.1 秒
    • Thinking 模式(Claude 驱动)178.5 秒
    同一套 Asta 流程下两种模式的单篇报告生成耗时

    没写清 材料没有公布引用归属(attribution)的量化准确率,也没有第三方复现结果,所以事实一致性到底掉多少,不能替它补齐。

    下一步 下一步看 allenai 是否公布与 2026 年前沿闭源模型的对照评测,或给出引用准确率的具体数字。