精选深读Google DeepMind01:08
推出基于Gemini的智能体视频理解
Introducing agentic video understanding with Gemini
视频理解转向行动决策,但实时交互延迟仍是落地瓶颈。
判断
决定长视频分析算力预算的团队,现在可以把「固定抽帧」换成让模型自己扫描,但只该先切在离线批处理上;一旦放进实时交互,省下的 token 换不来延迟上限,这笔账由盯端到端延迟的那个人付。
依据
Google DeepMind 高级产品经理 Rohan Doshi 与研究总监 Mario Lučić 在 2026年9月1日的发布里说,新功能把模型的原生视频工具接进推理:静态处理按固定帧率(frames per second,即每秒取帧数,默认 1 FPS)整段吞视频,智能体视频理解则让模型自己搜索、扫描、回看目标片段,覆盖画面、音频和转写文本。官方给的对照数字是 token 消耗最多降 88%、分析成本最多降 66%、准确率最多升 7%,长视频(10 分钟教程到 90 分钟讲座、数小时录像)收益最大。取舍就在这里:88% 和 66% 都是「最高」值,也就是最好个案,而静态处理虽然贵,每段视频要喂多少帧是事先可算的;换成动态扫描后,扫描次数由模型临场决定,成本与耗时从固定值变成浮动值,实时交互那一步就没有可对外承诺的上限。启用方式是把 API 配置设为 agentic,在 Google AI Studio 或 Gemini Enterprise Agent Platform 生效。
- token 消耗最高降 88%
- 分析成本最高降 66%
- 准确率最高升 7%
没写清 材料没有给动态扫描的单次耗时或端到端延迟数字,也没有扫描次数上限,所以无法替它判断实时交互能否达标。
下一步 在同一段 90 分钟录像上分别跑 static 与 agentic 配置,记录 token 用量与端到端耗时。