跳到正文

2026年09月06日AI 版

6 条 · 4 个来源

头版

行业动态OpenAI

一线防御者的黎明:10亿美元保护关键服务
OpenAI十亿美元押注关键服务,但前沿AI防御工具的实际落地效果待观。

电力、水务这类关键服务的运维负责人,在排明年安全预算时多了一个先后选择:先申请 Daybreak 的资助与培训,再决定自购哪些防护产品。

展开全文

依据

OpenAI 宣布 Daybreak 项目,以十亿美元规模向关键服务领域提供前沿网络 AI(此处指用于网络攻防的前沿模型工具)、培训及支持。机制上,这笔钱买到的不是修好的漏洞,而是一条「模型部署—人员培训—日常运维」的转化链:AI 只负责加强防御能力,缺口仍需机构自己补。材料划定适用对象是电力、水务等民生必需服务,取向偏向高价值基础设施;对资源有限的基层机构,即便拿到资助,吸收这类技术的人力与制度门槛依旧存在,同一笔钱落到不同规模的机构,落地速度不会一样。

没写清 材料没说这十亿美元的分期与验收口径,也没说防护效果用什么指标量化。

下一步 可核对 OpenAI 是否公布首批受资助机构名单与部署时间表。

AI工具

2

  1. AI工具Simon Willison

    在macOS上使用Blender与编码Agent
    编码Agent实操Blender,macOS场景验证,但无性能数据,适用有限。

    做3D草模外包决策的独立开发者,可以先在本机装好的 Blender 上让编码智能体跑出第一版,省掉的是询价和等稿那一步;要不要把它接进正式渲染管线,得等有耗时和失败率这类数据再定。

    展开全文

    依据

    Simon Willison 在 2026年9月5日的 TIL(Today I Learned,他本人的短笔记栏目)里说,现代前沿模型用 Blender——开源 3D 建模与渲染软件——已经「相当好」。他的做法是:先从 blender.org 安装完整的 Mac 应用,再给编码智能体下指令「用已安装的 /Applications/Blender 渲染一只骑自行车的鹈鹕」,随后追加「加背景和大量花样」「整体做好很多」。机制是模型调用 Blender 的 Python API(用脚本驱动建模、材质与渲染的接口),产出的 .blend 文件能回到 Blender 里手动继续改,也能渲染图片序列再用 ffmpeg(拼接视频的命令行工具)合成影片。这次会话跑在他的 Codex 订阅额度内,AgentsView 按 API 价折算,gpt-6-astra 要花 $4.24。他博客的标签计数里,blender 只有 4 篇,coding-agents 有 251 篇。

    • ai2,247
    • coding-agents251
    • gpt-6-astra9
    • blender4
    博客标签计数:blender 相关仅 4 篇,coding-agents 有 251 篇

    没写清 材料没提渲染耗时、机器规格、重试或失败次数,也没有与人工建模的对照,所以不能替它判断这条流程在正式管线里是更快还是更慢。

    下一步 自己跑同一条鹈鹕提示词,记下发指令到 .blend 落盘的分钟数和重试次数。

  2. AI工具Simon Willison

    Astra的Pelican对比网格相当有趣
    网格直观对比Astra与竞品,省去逐个调研,但需自行验证数据时效性。

    如果挑模型的依据是单张出图成本而不是每百万 token 标价,这张网格会把 Astra low 直接放进候选,并把 Sol 的 xhigh 从默认首选降为备选。

    展开全文

    依据

    Simon Willison 在 9月4日拿到 GPT-6 Astra,用同一个提示让它在 low、medium、high、xhigh、max 五个推理档位(reasoning level,即模型分配多少思考量的档位;Astra 不支持 reasoning=none)画骑自行车的鹈鹕,再与 GPT-5.6 Sol、Terra、Luna 的成品并排成一张对比网格。他的结论是 Astra 明显更强:Sol 最好的一档(他认为 xhigh 比 max 好)仍只是一堆抽象色块,而 Astra 从 low 到 xhigh 每一张都更好;但 Astra 在 max 以下仍不能稳定把鹈鹕两条腿都放进画面。成本上 Astra 约为 Sol 的两倍(每百万 token(令牌)输入 10 美元、输出 50 美元,Sol 为 5/30),不过它各档消耗的 token 明显更少,实际各档差价小于标价差:Astra low 花 9.55 美分做出的鹈鹕就胜过任何 Sol 档位。他还注意到 Astra 与 Luna 都只用 16 个输入 token,Sol 与 Terra 都是 26,于是怀疑前两者的关系更近。

    • Astra 每百万 token$10/$50
    • Sol 每百万 token$5/$30
    • Astra low 单张鹈鹕9.55 美分
    • 输入 token(Astra/Luna 与 Sol/Terra)16 与 26
    Astra 与 GPT-5.6 Sol 的标价、单张成本与输入 token 对照

    没写清 网格只有 Willison 一人的观感判断,没有评分、样本量与复测日期,9月4日之后模型是否改过也无从核对。

    下一步 去 OpenAI 定价页核对 Astra 是否仍是每百万输入 10 美元、输出 50 美元。

精选深读

3

  1. 精选深读Simon Willison

    面向开发者推出GPT-6 Astra
    开发者版GPT-6 Astra姗姗来迟,但API细节未披露,或成追热点软文。

    做 3D 资产管线的团队若正在选模型,这条只能当预告:它证明 Astra 能出花园、船厂、戴森球的渲染图,却不证明这些图能按稳定单价批量复现。定价和限流公布前,把接入预算留给能压测的现有模型。

    展开全文

    依据

    Simon Willison 在 9月5日的 link post(链接帖,只贴外链加一句点评,不含评测方法)里引了一段视频的说法:Astra「在各方面更注意细节、更懂用户的提示词、能构建更复杂的输出」,尤其擅长 3D 建模,他见过花园、船厂、动物、城市景观乃至戴森球的渲染。他自己添的一句是「眨个眼就错过,1分59秒处有只熟悉的生物」,指向他博客里长期当模型试金石的「鹈鹕骑自行车」梗。材料里没有上下文窗口、每百万 token 价格、延迟或通过率这类可比数字,能对照的只有博客标签计数:ai 2,247、generative-ai 1,992、llms 1,958、openai 466,而 gpt-6-astra 只有 9。换句话说,这个型号在他站上只有 9 篇的量级,其余数字是旧标签累积的结果,拿标签总量去推 Astra 的能力会被误导。

    • gpt-6-astra 标签9 篇
    • openai 标签466 篇
    • llms 标签1,958 篇
    • ai 标签2,247 篇
    博客标签计数对照:关于 GPT-6 Astra 的累积材料只有 9 篇,远少于旧标签。

    没写清 材料没说 Astra 的 API 价格、限流和上下文长度,也没说那批渲染是几次生成、耗时多久,所以不能替它算成本或成功率。

    下一步 盯 OpenAI 开发者文档里 gpt-6-astra 的定价与限流页是否在 9月内上线,或 Willison 9月12日那篇生成跑步路线的文章是否给出可复现的调用细节。

  2. 精选深读Google DeepMind

    推出WeatherNext 3:我们最先进、最准确的全球天气AI模型
    天气预报精度卷到AI,Google称全球最准,但官方口径待独立验证。

    做当日排产的人——风电出力预测、灌溉调度、户外活动主办方——可以把 Google 搜索和地图里的逐小时预报接进自己的时间表;但决定“是否据此调整计划”之前,得先分清这是模型输出,不是气象部门的官方预警。

    展开全文

    依据

    Google DeepMind 的 The WeatherNext team 在 Sep 03, 2026 的博客里,把标题写成“our most advanced and accurate global weather AI model”,并称新版比此前版本 five times sharper(原文即此措辞,未给具体评分)。机制上,模型先用历史记录学天气演变的统计规律,这次改为在推理时吃进实时卫星数据,替代部分传统物理模拟(physics simulations,即按大气运动方程逐格点推演),因此能做逐小时刷新和更高分辨率的降水预报,并把结果铺进 Search、Gemini、Maps、Google Maps Platform 和 Cloud。另一处细节是:页面上的摘要本身标注为 Google AI 生成且“Generative AI is experimental”,也就是说“更准”的表述在这一页里同样由 AI 摘要转述,属于谷歌自述口径。

    1. 实时卫星数据输入
      驱动
    2. 逐小时刷新
      产出
    3. 更高分辨率降水预报
      分发
    4. 接入搜索/地图/Gemini
    从卫星观测输入到逐小时预报产出,再分发到 Google 各入口

    没写清 材料没有给出独立机构的同场对比:哪个站点、哪段时间、把 WeatherNext 3 与官方数值预报做过同期误差评分,这块只能等外部验证。

    下一步 盯一次可核对的第三方评分:某国气象部门或研究机构把 WeatherNext 3 的逐小时降水预报与自家业务模式在同一批站点上比对并公布结果。

  3. 精选深读Hugging Face

    NeoMME:高效的多模态原生和多语言编码器
    新编码器同时处理多模态与多语言,效率提升或受限于模型规模,适合跨语言检索场景。

    跨语言视觉文档检索团队原来要在“上生成式 VLM 换多模态能力”和“保留分离编码器省算力”之间选;NeoMME 让 260M 直接进候选,但代价是索引栈要改成晚交互加量化,否则拿不到 6 kB/页的存储收益。

    展开全文

    依据

    Hugging Face 团队说,NeoMME 是 260M 和 800M 的多语言多模态编码器,不用单独预训练视觉塔,也不用因果语言模型;它把文本 token 和 32×32 图像 patch 送进同一个双向 Transformer,从头用 masked discrete-diffusion(离散掩码扩散:遮住部分文本再让模型重建)训练。检索、分类和 token 标注不靠自回归生成文本,所以团队砍掉 causal decoder(因果解码器:逐词生成文本的模块)的参数和算力,并用动态分辨率让高分辨率文档页占更多 token。对做 visual document retrieval(视觉文档检索:用页面图像找文档)的人,NeoMME-Retriever 一次前向同时返回 dense 和 late-interaction embedding(密集向量与晚交互向量:后者保留多向量做细粒度匹配)。可对照的是:在 NVIDIA L40S GPU、2048×2048 输入下,260M 每秒约 51 页,约为 ColModernVBERT 的两倍;分层 token pooling(分层 token 池化:把多个 token 向量合并成更少向量)和非对称量化把晚交互索引从约 1.5 MB/页压到 6 kB/页,缩小 255×,同时保留 >95% baseline nDCG@10(前 10 条排序质量指标)。取舍在于省掉视觉塔和生成解码器降低基础模型开销,但晚交互索引仍需单独存储和量化;若团队已押注单向量索引或生成式 VLM 后处理,迁移成本不在编码器本身。

    • 260M 编码吞吐约 51 页/秒
    • 对比 ColModernVBERT约 2 倍
    • 晚交互索引每页约 1.5 MB → 6 kB
    • 索引压缩后 nDCG@10>95% 基线
    NeoMME 的吞吐、索引压缩与质量保留对照

    没写清 材料没给 NeoMME 在非英语、非拉丁语系查询上的单独 nDCG@10,也没说 260M 与 800M 在同样索引压缩下的检索质量差,因此不能替它判断哪一档该优先。

    下一步 下一步看 Hugging Face 的 NeoMME collection 或技术报告是否放出 ViDoRe v3 上 260M/800M 的逐语言 nDCG@10 和 6 kB/页配置的复现脚本。