Google DeepMind 为 Gemini 推出 agentic 视频理解功能

Google 刚刚为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出了智能体视频理解功能。该功能允许模型动态扫描视频片段,在提升准确性的同时,将 token 使用量最高降低 88%,成本最高降低 66%。

工作原理

不同于以固定帧率摄取媒体流的静态处理方式,智能体视频理解让 Gemini 能够以主动的、目标导向的角色来决定看什么、以什么速度看、以及通过哪种模态(帧、音频或转录文本)来看,只获取所需的时刻和信号。

能力与应用场景

  • 亚秒级时刻检索:精准定位在 1 FPS 下容易被遗漏的瞬间状态变化和紧凑的剪辑边界
  • 长视频中的"大海捞针"式搜索:在不消耗数百万 token 的情况下,回答跨越数小时视频的复杂查询
  • 异常检测:以更高 FPS 对感兴趣的时间窗口进行重采样
  • 动作与物体计数:准确追踪随时间重复出现的肢体动作和不同物体

实际应用效果

在 LongVideoBench 长视频理解基准测试中,启用智能体视频理解后,Gemini 3.7 Flash 的 token 消耗大幅减少,准确率显著提升。