跳到正文

汪汪简报

周四 · 2026年09月17日

全部新闻

  1. 行业动态OpenAI

    我们报告模型失准的框架
    OpenAI把模型失准披露流程公开,安全团队可对照自查缺口。

    安全负责人要改的不是复盘模板,而是评审门槛:失准一旦确认,谁签字、几个工作日内对外披露,必须先写成能被外部对照的硬约束,否则公开流程只会先暴露自己没写的那部分。

    展开全文

    依据

    OpenAI 这次没解释某一起具体事件,而是把「追踪—调查—披露」三个环节写成对外可见的流程,同时放出六份关于模型异常或令人担忧行为的报告。机制是:过去失准处理停在内部复盘,现在流程公开,安全团队的披露口径和响应时效会被外部横向比较,谁慢谁快成为可被指认的事实,这等于把内部标准变成外部证据。代价也随之转移——披露写得越细,自家对齐监测的覆盖范围就越容易被反推;而适用范围偏向有能力做对齐监测的组织,监测能力弱的团队照抄流程,往往先暴露短板。所以它不像一份安全声明,更像一份把责任压到具体签字人和时间点上的日程约束。

    1. 追踪异常
      移交
    2. 调查定性
      出结论后
    3. 对外披露
    从发现异常到对外披露的三步流程

    没写清 材料只有来源摘要,没给框架的具体判定标准,也没说那六份报告是否经过独立验证,因此不能替它补上「披露已足够彻底」这个结论。

    下一步 看 OpenAI 后续是否公开这六份报告各自的判定标准,以及由谁做独立复核。

  2. AI工具The Verge AI

    Snap 推出新的 Specs AI 工具,并将登陆 iOS 和 Mac
    Snap押注主动式助理,想抢在Meta和谷歌前占场景,但先发版仅限iOS。

    它改变的是把日程托管在 Gmail、Slack 的人要不要再开一个常驻账户:Snap 把提醒从你开口问提前到会前主动推送,代价是你先把跨应用上下文交给它,而这份上下文目前只在 iOS 预览里跑。

    展开全文

    依据

    Snap 说 Specs Intelligence 是一个「anticipatory AI service」,即预判型 AI 服务:用户连上 Gmail、Slack 等账户后,它在会议前主动提示待决事项、汇总行程和互相冲突的工作截止日期,而不是等用户提问。机制上,Snap 说模型由托管在美国的开源模型与本地 LLM(大语言模型)组合而成,并声称所连接账户里的个人内容不会被用于训练 Snap 模型或投放个性化广告。台面上的对照是两个对手:Meta Muse 与 Gemini Spark,Snap 想靠「主动预判加跨设备上下文」先占住场景。可核对的口径本身不一致:英文标题写「coming to iOS and Mac」,正文只给 iOS 预览、Mac 进等待名单。

    没写清 Snap 未公开预览版与完整体验的差异,主动提示能否逐条关闭、误报时怎么纠正也没说,所以它的实际能力边界无法替它补上。

    下一步 等 Snap 公布 Mac 等待名单的开放时间,或预览是否扩到 Android,届时再核对「主动提示」是否默认开启。

  3. AI工具Wired AI

    我训练了一只苍蝇的大脑来生成 WIRED 故事创意
    PitchFly拿果蝇脑图谱生成选题,脑洞够大,但只适合消遣别当选题库。

    编辑应把 PitchFly 从选题库候选降为创意热身工具:可以拿它破冰,但不能把它的输出直接送进选题会。若要升级为工具评估,先让提出者交出连接组调用与输出可复现的证据,否则不投入编辑判断。

    展开全文

    依据

    PitchFly 作者把果蝇连接组(connectome,即神经元连接图谱)当生成器:抓取 WIRED 一年内高表现标题,经 Codex(这里指把标题转成神经网络表示的模型)转成词与短语表示,再喂入连接组,让它按已见模式重组出选题。机制上的限制是,果蝇脑不理解词语或语义,只复现模式,所以输出噱头足却缺少可验证的新闻判断。它的可取之处是演示价值:连接组已开源,几天内出现 Beat Saber、炒股、玩 Doom 等衍生项目,说明个人用提示就能训练并部署专属小模型;但作者承认未核实这些项目是否真的调用连接组,部分可能是动画或恶搞,且该脑本身没有“选题能力”。因此编辑可以拿它做科普与创意热身,代价是仍要自己承担核实、筛选和判断;若把生成结果当选题库,失败会发生在选题会而不是模型端。

    1. 抓取高表现标题
      转码
    2. 转成神经表示
      输入
    3. 喂入果蝇连接组
      重组
    4. 按模式重组选题
    从抓取标题到重组选题的流程

    没写清 材料没给这些衍生项目调用连接组的代码、运行日志或 PitchFly 生成选题被编辑采用的比率,所以无法验证它到底有多少可复现的选题能力。

    下一步 下一步可核对 Beat Saber、炒股、玩 Doom 项目是否公开调用连接组的代码或运行记录;若只有演示视频,就按恶搞处理。

  4. AI工具The Verge AI

    Google 现在将允许任何 AI Agent 控制你的智能家居
    Google开放MCP接入,Claude等第三方可代控设备,权限风险得自己盯。

    这改变的是用户是否让第三方 AI 代理控制家庭设备的决定:接入门槛更低,但授权粒度、审计和责任兜底仍未交代,便利归你,误操作或滥用的风险也归你。

    展开全文

    依据

    The Verge AI 这篇报道说 Google Home 将开放 MCP(一种标准化协议)接入,Claude、Hermes、Open Claw 等第三方 AI 代理可读取设备、事件历史并代为操作。机制上,代理不必为每类设备单独适配,接入门槛因此降低。原文用“securely”(安全地)描述安全性,却没有给出授权粒度、操作审计和责任边界;设备控制与家庭数据又高度敏感,所以当代理出错或被滥用时,用户缺少可追责的兜底。愿意用通用 AI 助手统一调度且能自行评估权限风险的人,才是这项变化的主要适用对象。

    1. 支持 MCP 的第三方代理
      接入
    2. 读取设备与事件历史
      控制
    3. 代为操作设备
    第三方 AI 代理接入 Google Home 后读取数据并代为操作的链路

    没写清 材料没说明授权粒度、审计方式和责任边界,所以无法替它补上第三方代理误控后用户能否追责这一环。

    下一步 下一步可核对 Google 是否公布 MCP 接入的权限范围、审计日志与责任划分说明。

  5. 精选深读Simon Willison

    Claude Cowork 与聊天现已合并为一个 Claude
    Claude把协作与聊天合并,团队协作场景更顺,但个人多线程用法得重新适应

    团队负责人现在可以把『协作』和『问答』合并进同一份 Claude 采购与权限规划;个人多线程用户却要重估自己那套 Cowork/Claude/Claude Code 三分工——合并省掉的是学习成本,代价是单入口下的并发排队。

    展开全文

    依据

    Simon Willison 在他的博客里写道,他本就打算搞清楚 Cowork、Claude、Claude Code 三者的边界,这次合并替他省了这份工;但他补了一句,弄明白合并在功能和入口上到底意味着什么,仍要花不少功夫。机制上,合并后同一个 Claude 既接随手一问,也接中午前要交的报告,任务在你合上笔电后继续跑,而且先在 Pro 和 Max 套餐开放,未来数周覆盖 web、桌面与移动端。他由此判断 Claude 正在变成独立的通用 agent(general agent,指能自己持续执行多步任务、而不只是回话的助手),并把它与 OpenAI 几周前把 Codex 桌面应用改名 ChatGPT 放在一起对照。取舍在于:一个入口减少了选择成本,但原本靠不同产品线做任务隔离的个人用户,得在同一个入口里重排自己的并行用法。

    1. Cowork 与 chat 合并
      今日起
    2. 先开放 Pro / Max
      未来数周
    3. 再覆盖 web、桌面、移动端
    这条链路讲的是合并后按套餐、按终端逐步铺开的顺序。

    没写清 材料没说 Claude Code 是并进这个入口还是保持独立,这一步决定了个人用户还能不能按产品线分工。

    下一步 接下来可核对的是 Free 与 Team 套餐是否跟进开放,以及官方是否给出入口合并后的功能对照表。

  6. 技术与协议CoinDesk

    Revolut黑客索要300万美元门罗币,威胁出售客户数据
    黑客专挑持币大户下手,数据泄露风险集中,Revolut仅24小时应对窗口偏紧。

    Revolut 的安全与合规负责人要在倒计时走完前定下:主动冻结并逐户通知那批已被读取资料的账户,还是按常规节奏等执法方接手——前者付出误冻结和提前引爆舆情的代价,后者把数据扩散的账单留给客户。

    展开全文

    依据

    自称「iamnotavillain」的组织对英国《金融时报》说,他们索要 6,000 枚门罗币(XMR,一种以隐藏交易双方与金额为设计目标的加密货币),并挂出倒计时。他们给出的手法不是随机撞库,而是先用区块链分析(blockchain analysis,即通过链上转账记录反推地址归属和持仓规模的技术)挑出在 Revolut 持有大量加密资产的账户,再定向取数据。这让两件事变成同一条链条:冒充政府官员的索取函骗过了 Revolut 的审核,客户在链上的余额又替攻击者完成了名单筛选——泄露的不是随机 680 个账户,而是被链上数字标记过的那批人。Revolut 对 CoinDesk 说没有收到对方任何直接联系或索要,并称系统与客户资金未受影响。

    • 索要赎金6,000 枚 XMR
    • 折合金额300 万美元
    • 受影响账户至少 680 个
    • 支付窗口24 小时
    赎金、折合金额、波及账户数与支付窗口四个可核对数字

    没写清 材料没有交代 6,000 枚 XMR 折算成 300 万美元的时点与汇率,也没给出 680 个账户的持仓分布,所以无法判断被链上筛中的持仓门槛具体落在哪一档。

    下一步 看 Revolut 在倒计时截止后是否发布事件更新,以及是否有账户数据被确认在其他犯罪群组挂牌出售。

  7. 技术与协议Decrypt

    Bitcoin Core软件更新着眼于速度与安全补丁
    Bitcoin Core 32.0进终测,提速与钱包改动需评估升级成本。

    节点运营方和钱包维护者要决定是否在 10月10日最终版发布前完成 Bitcoin Core 32.0 兼容性测试,否则钱包准备支付时用的交易格式改动可能带来额外升级成本。

    展开全文

    依据

    Decrypt 报道称,Bitcoin Core 32.0 已进入最终测试,开发者把 10月10日定为目标发布日,这个版本会加快部分区块检查,并改动钱包准备支付时使用的一种交易格式。Bitcoin Core 是比特币网络最主流的节点软件;节点先跑新区块验证路径,钱包再按新格式构造交易。若矿池、交易所或自托管钱包仍用旧格式广播,兼容问题会暴露在交易中继环节。材料没有给出提速幅度、被改格式的名称,也没有旧钱包不升级时的具体失败表现。

    没写清 材料没说交易格式改动叫什么、旧钱包不升级会在哪一步失败,也没给升级成本数字。

    下一步 到 10月10日核对 Bitcoin Core 32.0 最终版是否发布,并看发布说明是否要求钱包改交易格式。

  8. 机构与应用Chainalysis

    Chainalysis支持Arc,自动代币支持功能上线
    Chainalysis接入Arc,稳定币合规监控自动化,省事但依赖其规则。

    让 Circle 生态里的稳定币发行方和 VASP 合规团队,把 Arc 上新币的监控从自建或人工排查,换成默认走 Chainalysis KYT——省掉登记工,代价是告警口径由 Chainalysis 定。

    展开全文

    依据

    Chainalysis 9月16日宣布支持 Arc——Circle 全栈平台内一条专为稳定币金融打造的 EVM 兼容 Layer 1(第一层公链),用稳定币付 gas,起手是 USDC,亚秒级最终性,吞吐 3,000+ TPS。所谓「自动代币支持」指的是:凡符合 ERC-20(同质化代币标准)与 ERC-721(非同质化代币标准)的新代币,一经铸造即被纳入平台,无需人工登记;客户通过 KYT(Know Your Transaction,实时交易监控)收告警,并在 Reactor 里追踪跨 Arc 的资金流。取舍在这里:合规团队换来的是新币铸造当天就有覆盖,让渡的是判定权——哪类地址、什么行为触发告警,由 Chainalysis 的规则库决定,机构只能在其告警之上做二次判断,规则改了也只能跟。

    1. 新代币铸造
      无需人工
    2. 自动纳入Chainalysis
      持续监控
    3. KYT实时告警
      告警后追溯
    4. Reactor追踪资金流
    新代币从铸造到可被追踪的四步链路

    没写清 材料没写不符合 ERC-20/ERC-721 的代币会被怎么处理——是漏检还是转人工,也没有 KYT 的告警阈值和误报率。

    下一步 下一步可核对 Chainalysis 或 Circle 是否公布 Arc 自动覆盖的代币数量,以及非 ERC-20/721 代币是否在列。

往期

  1. 09.29周二

  2. 09.28周一