Gemini 不再逐帧看视频,省下的 token 来自先决定哪里值得看
Google 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 Agentic Video Understanding。传统视频输入按固定采样率把画面送给模型,新模式会先搜索、扫描,再针对可能相关的时间段重新取样,并联合使用音频与字幕。
作者:林岚|OC 开发者生态编辑
Google 为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出 Agentic Video Understanding。传统视频输入按固定采样率把画面送给模型,新模式会先搜索、扫描,再针对可能相关的时间段重新取样,并联合使用音频与字幕。
一句话结论:视频理解的下一步不是让模型“看更多帧”,而是让它像剪辑师一样先判断哪里值得细看;成本下降来自选择性注意,代价则是第一轮搜索漏掉的片段可能永远进不了精读阶段。
固定一帧每秒的做法简单可预测,却有两个问题:长视频会产生大量相似 token,短暂异常又可能恰好落在采样间隔里。Agentic 模式把问题拆成检索与分析,先用低成本信号定位候选片段,再动态提高相关位置的采样密度。Google 称,在内部测试中最多可减少 88% token、降低 66% 分析成本,并把准确率提高最多 7%。
“最多”是这里最重要的限定。会议录像、体育比赛、监控视频和高速制造线的时间结构完全不同。事件稀疏、问题明确的长视频最可能受益;若任务要求逐帧计数或捕捉瞬时细节,预筛选本身就会成为新的误差源。开发者仍要用自己的漏检成本决定是否开启,而不能把 88% 当作统一折扣。

功能已经通过 Gemini API、Google AI Studio 和 Gemini Enterprise Agent Platform 提供,支持上传视频与 YouTube 内容。调用时可设置 processing: "agentic",按现有 token 价格计费,没有单独功能费。Google 计划稍后把它带到 Gemini 应用和 Ask YouTube。
新的可观测性也必须跟上。一个会自主选择时间段的系统,输出答案之外还应记录搜索过哪些范围、哪些片段被跳过、最终证据来自何处。否则用户看到的是更便宜的答案,却无法区分模型“看过但理解错”与“根本没看见”。
关键事实
- Agentic Video 已覆盖三款 Gemini Flash 系列模型,并通过 API 与企业平台提供。
- Google 宣称最多减少 88% token、降低 66% 成本、提高 7% 准确率,均为内部条件下的上限结果。
- 系统会动态搜索与重新采样视频,而不再只依赖固定帧率。
OC 判断
视频代理把计算预算从平均分配改成按疑似价值分配,是多模态系统走向实用的重要一步。但越是选择性观看,越需要证据时间码和覆盖日志。节省 token 不应以隐藏漏检位置为代价。
为什么重要
- 对开发者:长视频检索成本可能显著下降,但要单独测漏检率。
- 对企业:审计、安防和质检应用需要保留模型实际查看范围。
- 对用户:回答应能跳回证据片段,而不只是给出自然语言结论。
评论
围绕这篇文章补充信息、提出问题或分享观察。