「不是多看,而是会回看」——Google 把视频理解从吞上下文改成了主动取证

2026-09-08 · 多模态 · 视频理解 · 智能体 · 推理效率
视频理解正从固定采样转向目标驱动的主动取证,但效率与精度收益仍需独立、分任务验证。

先说结论

Google 这次最值得记住的,不是“视频理解准确率又提高了 7%”,而是它换了一种看视频的方式:模型不再把整段视频按固定节奏塞进上下文,而是先判断问题需要什么证据,再决定看哪一段、用多少帧、读画面还是听音频,必要时回看。

这意味着多模态模型的竞争,正在从“能吞下多少内容”转向“知道该把注意力和算力花在哪里”。看得更多未必更聪明;会主动找证据,才更接近可用的视觉智能体。

事情是怎么发生的

9 月 1 日,Google DeepMind 的 Rohan Doshi 与 Mario Lučić 发布 Gemini 的 agentic video understanding。传统静态模式默认每秒抽取一帧,一次性放入上下文;新模式让模型在推理过程中调用内部视频工具,动态请求某段时间轴的画面、音频或转录,并调整帧率和分辨率。

Google 报告,在其测试中,长视频任务最多减少 88% token、降低 66% 成本,同时质量最高提升约 7%。这几个“最多”不能相加成一个普遍结论,更不是独立评测。官方开发文档也写得很清楚:实际消耗取决于问题复杂度和动态采样深度;需要逐帧检查的任务,静态模式仍可能更合适。

为什么重要

长视频的难点从来不只是上下文长度。一个小时的视频,真正回答问题所需的证据可能只有两秒;固定一帧每秒会漏掉快速动作,把帧率整体拉高又会让 token 和延迟随时长上涨。主动取证把这个矛盾改写成搜索问题:先粗看,再定位,再局部加密采样。

这条思路并非 Google 首创。2024 年的 VideoAgent 已让大模型迭代挑选关键帧,在两项长视频问答基准上平均只使用约八帧。Google 的关键动作,是把研究原型变成 API 内的处理模式,并让开发者看到模型实际发出的 processing_call。路线由论文走进基础设施,才是更大的信号。

站得住与站不住的地方

站得住的是机制:对于证据稀疏、视频很长、问题明确的任务,按需加载天然比全量摄入更省;对一闪而过的动作局部提高帧率,也比全片统一加码更合理。检索、计数、异常定位和视频剪辑,都可能因此从“昂贵演示”变成可部署功能。

站不住的是外推。模型先判断哪里值得看,一旦第一轮定位错了,后面再高分辨率回看也只会把错误看得更清楚。厂商公布的是“最高”收益,尚未说明各任务分布、失败率,以及节省 token 是否换来了更多串行工具调用和等待时间。主动取证减少了输入,却新增了搜索策略本身的误差。

接下来该盯什么

下一阶段真正有区分度的指标,不再只是长视频问答总分,而是证据召回率、停止时机、端到端延迟,以及答案能否指回准确帧段。更长的上下文窗口不会消失,但它可能从主角退成保险箱:模型平时主动寻找少量证据,只有不确定时才扩大观看范围。

如果这条路线成立,未来的多模态系统不会只是“什么都看过”,而要能说明:它为什么看这里、漏掉了什么、还需要再看哪里。