跳到正文

汪汪简报

周三 · 2026年09月02日

Crypto 版当天未出刊,不用往期内容顶替——这份组合就是这天实际发布的全部。

全部新闻

  1. 精选深读Google DeepMind

    推出基于Gemini的智能体视频理解
    视频理解转向行动决策,但实时交互延迟仍是落地瓶颈。

    决定长视频分析算力预算的团队,现在可以把「固定抽帧」换成让模型自己扫描,但只该先切在离线批处理上;一旦放进实时交互,省下的 token 换不来延迟上限,这笔账由盯端到端延迟的那个人付。

    展开全文

    依据

    Google DeepMind 高级产品经理 Rohan Doshi 与研究总监 Mario Lučić 在 2026年9月1日的发布里说,新功能把模型的原生视频工具接进推理:静态处理按固定帧率(frames per second,即每秒取帧数,默认 1 FPS)整段吞视频,智能体视频理解则让模型自己搜索、扫描、回看目标片段,覆盖画面、音频和转写文本。官方给的对照数字是 token 消耗最多降 88%、分析成本最多降 66%、准确率最多升 7%,长视频(10 分钟教程到 90 分钟讲座、数小时录像)收益最大。取舍就在这里:88% 和 66% 都是「最高」值,也就是最好个案,而静态处理虽然贵,每段视频要喂多少帧是事先可算的;换成动态扫描后,扫描次数由模型临场决定,成本与耗时从固定值变成浮动值,实时交互那一步就没有可对外承诺的上限。启用方式是把 API 配置设为 agentic,在 Google AI Studio 或 Gemini Enterprise Agent Platform 生效。

    • token 消耗最高降 88%
    • 分析成本最高降 66%
    • 准确率最高升 7%
    Gemini 智能体视频理解官方给出的三项对照数字

    没写清 材料没有给动态扫描的单次耗时或端到端延迟数字,也没有扫描次数上限,所以无法替它判断实时交互能否达标。

    下一步 在同一段 90 分钟录像上分别跑 static 与 agentic 配置,记录 token 用量与端到端耗时。

  2. 精选深读Hugging Face

    BenchMIRT:LLM基准测试到底在衡量什么?
    基准测试衡量标准存疑,选型需谨慎,避免被榜单误导。

    评测和选型负责人不能再把 BBQ、WMDP 等安全基准的总分直接当成安全能力信号;要决定是否为这些榜单做题目(prompt)级拆题,否则会为推理能力买单却误判安全行为。

    展开全文

    依据

    AllenAI 的 Kyle Wiggers 称,BenchMIRT 在题目(prompt)级审计大型语言模型(LLM)基准,并公开技术报告、数据和代码。它借用心理测量学里的 Item Response Theory(IRT,项目反应理论)——用答题模式估计能力——再扩展成 multidimensional IRT(MIRT,多维项目反应理论),把同一批题上的多种能力拆开。它在 100 个 LLM、16 个基准、超过 34K 道题上训练,未被告知基准标签,却独立恢复出 safety(安全)和 general reasoning(通用推理)两个主导维度,换一次分析仍出现。机制上,BBQ 原测社会偏见、常被归入安全,但这里更贴近 general reasoning;WMDP 测生物、化学、网络安全等危险双重用途知识,也更强关联 general reasoning,且 general reasoning 越强 WMDP 分数越低,因为拒绝或答不出危险知识才算期望回答;HarmBench 的标准与情境题更贴 safety,版权题更贴 general reasoning。把这类题平均成一个分数,会让选型方误把推理难度当成安全表现。

    • LLM 数100
    • 基准数16
    • 问题数超过 34K
    • 主导维度2
    BenchMIRT 审计规模:100 个 LLM、16 个基准、超过 34K 道题,并恢复出 2 个主导维度。

    没写清 材料没给 BBQ、WMDP、HarmBench 各题在两个维度上的载荷值,也没说这些归属会不会随模型版本或题目改写而漂移,因此不能替它补出具体阈值。

    下一步 下一步可下载 AllenAI 的 BenchMIRT 数据集,核对 BBQ 与 WMDP 的维度载荷,并复跑同一批 100 个 LLM,看 safety/general reasoning 归属是否复现。

往期

  1. 09.29周二

  2. 09.28周一