精选深读Google DeepMind01:04
推出Gemini 3.7 Flash
Introducing Gemini 3.7 Flash
Gemini 3.7 Flash主打低延迟,但长文与复杂推理仍是短板。
判断
选型的人要改的那一步:把长文与复杂推理留在 3.6 Flash 或 Pro,只把低延迟的编码与 agent 循环迁到 3.7 Flash;否则省下的 token 价钱会以重试和返工的形式还回去。
依据
产品管理高级总监 Tulsee Doshi 代表 Gemini 团队发布 3.7 Flash,称它是「最适合编码与 agent 的工作马模型」,并说明这次上线距 3.6 Flash 只有三周,来自开发者反馈与算法改进。机制上最硬的一条是价格:每百万 token(per million tokens)的推广价为 3.6 Flash 原价的一半。对照数字全部来自 Google 自己列的评测:FrontierCode 1.1 Main 43.6% vs 34.4%,DeepSWE v1.1 65.3% vs 49.0%,GDP.pdf 34.0% vs 22.0%,AutomationBench 30.4% vs 17.0%,WebDev Arena 的 Elo(一种对战胜率换算的分值)1588 vs 1538。这些项目集中在调试、改 issue、文档处理和业务流程自动化,也就是短链路、可自动判分、可重试的任务。低延迟定位意味着长文与复杂推理是它让位的地方,代价落在把长篇推理塞进 Flash 的团队身上:一次超长上下文的失败往往要整段重跑,省下的单价会被重试次数吃掉。
- DeepSWE v1.165.3% vs 49.0%
- FrontierCode 1.1 Main43.6% vs 34.4%
- GDP.pdf34.0% vs 22.0%
- AutomationBench30.4% vs 17.0%
没写清 材料没给长文与复杂推理的对照数字,也没有任何延迟或吞吐数值,所以这两项到底差多少、差在哪个环节,不能替它补上。
下一步 等 DeepMind 公布 3.7 Flash 的长上下文或复杂推理评测数字,再核对这类任务是否仍需留在 3.6 Flash 或 Pro 上。