跳到正文

精选深读Google DeepMind01:08

推出基于Gemini的智能体视频理解

Introducing agentic video understanding with Gemini

视频理解转向行动决策,但实时交互延迟仍是落地瓶颈。

判断

决定长视频分析算力预算的团队,现在可以把「固定抽帧」换成让模型自己扫描,但只该先切在离线批处理上;一旦放进实时交互,省下的 token 换不来延迟上限,这笔账由盯端到端延迟的那个人付。

依据

Google DeepMind 高级产品经理 Rohan Doshi 与研究总监 Mario Lučić 在 2026年9月1日的发布里说,新功能把模型的原生视频工具接进推理:静态处理按固定帧率(frames per second,即每秒取帧数,默认 1 FPS)整段吞视频,智能体视频理解则让模型自己搜索、扫描、回看目标片段,覆盖画面、音频和转写文本。官方给的对照数字是 token 消耗最多降 88%、分析成本最多降 66%、准确率最多升 7%,长视频(10 分钟教程到 90 分钟讲座、数小时录像)收益最大。取舍就在这里:88% 和 66% 都是「最高」值,也就是最好个案,而静态处理虽然贵,每段视频要喂多少帧是事先可算的;换成动态扫描后,扫描次数由模型临场决定,成本与耗时从固定值变成浮动值,实时交互那一步就没有可对外承诺的上限。启用方式是把 API 配置设为 agentic,在 Google AI Studio 或 Gemini Enterprise Agent Platform 生效。

  • token 消耗最高降 88%
  • 分析成本最高降 66%
  • 准确率最高升 7%
Gemini 智能体视频理解官方给出的三项对照数字

没写清 材料没有给动态扫描的单次耗时或端到端延迟数字,也没有扫描次数上限,所以无法替它判断实时交互能否达标。

下一步 在同一段 90 分钟录像上分别跑 static 与 agentic 配置,记录 token 用量与端到端耗时。

本期其他新闻

  1. 行业动态

    Claude的新系统提示词确实不想重现歌曲歌词

    Simon Willison

  2. 行业动态

    引用Tarn Adams

    Simon Willison

  3. 行业动态

    AI原生公司如何将工作流转化为运营能力

    OpenAI

  4. AI工具

    ATV Big Air Tour借助ChatGPT将3天工作缩短为3小时

    OpenAI

  5. 精选深读

    在Confluent上利用IBM时间序列模型实现实时智能

    Hugging Face

  6. 精选深读

    BenchMIRT:LLM基准测试到底在衡量什么?

    Hugging Face