跳到正文

精选深读Google DeepMind01:04

推出Gemini 3.7 Flash

Introducing Gemini 3.7 Flash

Gemini 3.7 Flash主打低延迟,但长文与复杂推理仍是短板。

判断

选型的人要改的那一步:把长文与复杂推理留在 3.6 Flash 或 Pro,只把低延迟的编码与 agent 循环迁到 3.7 Flash;否则省下的 token 价钱会以重试和返工的形式还回去。

依据

产品管理高级总监 Tulsee Doshi 代表 Gemini 团队发布 3.7 Flash,称它是「最适合编码与 agent 的工作马模型」,并说明这次上线距 3.6 Flash 只有三周,来自开发者反馈与算法改进。机制上最硬的一条是价格:每百万 token(per million tokens)的推广价为 3.6 Flash 原价的一半。对照数字全部来自 Google 自己列的评测:FrontierCode 1.1 Main 43.6% vs 34.4%,DeepSWE v1.1 65.3% vs 49.0%,GDP.pdf 34.0% vs 22.0%,AutomationBench 30.4% vs 17.0%,WebDev Arena 的 Elo(一种对战胜率换算的分值)1588 vs 1538。这些项目集中在调试、改 issue、文档处理和业务流程自动化,也就是短链路、可自动判分、可重试的任务。低延迟定位意味着长文与复杂推理是它让位的地方,代价落在把长篇推理塞进 Flash 的团队身上:一次超长上下文的失败往往要整段重跑,省下的单价会被重试次数吃掉。

  • DeepSWE v1.165.3% vs 49.0%
  • FrontierCode 1.1 Main43.6% vs 34.4%
  • GDP.pdf34.0% vs 22.0%
  • AutomationBench30.4% vs 17.0%
3.7 Flash 与 3.6 Flash 在四项评测上的对照

没写清 材料没给长文与复杂推理的对照数字,也没有任何延迟或吞吐数值,所以这两项到底差多少、差在哪个环节,不能替它补上。

下一步 等 DeepMind 公布 3.7 Flash 的长上下文或复杂推理评测数字,再核对这类任务是否仍需留在 3.6 Flash 或 Pro 上。

本期其他新闻

  1. 行业动态

    开放模型现状:2026年夏季观察

    Hugging Face

  2. AI工具

    不要分类。要幻觉!

    Simon Willison

  3. AI工具

    使用Strands Agents、LeRobot和Hugging Face存储桶,在一个地方记录、训练和部署

    Hugging Face

  4. 精选深读

    GLM-5.3:中国实验室如何跟上前沿步伐

    Interconnects

  5. 精选深读

    GPT-5.6构建者指南

    OpenAI