-
aaideit_admin 管理员
Google DeepMind 为 Gemini 推出 agentic 视频理解功能
Google 刚刚为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出了智能体视频理解功能。该功能允许模型动态扫描视频片段,在提升准确性的同时,将 token 使用量最高降低 88%,成本最高降低 66%。
工作原理
不同于以固定帧率摄取媒体流的静态处理方式,智能体视频理解让 Gemini 能够以主动的、目标导向的角色来决定看什么、以什么速度看、以及通过哪种模态(帧、音频或转录文本)来看,只获取所需的时刻和信号。
能力与应用场景
- 亚秒级时刻检索:精准定位在 1 FPS 下容易被遗漏的瞬间状态变化和紧凑的剪辑边界
- 长视频中的"大海捞针"式搜索:在不消耗数百万 token 的情况下,回答跨越数小时视频的复杂查询
- 异常检测:以更高 FPS 对感兴趣的时间窗口进行重采样
- 动作与物体计数:准确追踪随时间重复出现的肢体动作和不同物体
实际应用效果
在 LongVideoBench 长视频理解基准测试中,启用智能体视频理解后,Gemini 3.7 Flash 的 token 消耗大幅减少,准确率显著提升。