谷歌为Gemini API推出Agentic Video Understanding功能,让模型自主决定观看哪段视频及检查方式。传统模式按1 FPS固定抽帧并一次性处理,新模式则沿时间轴智能定位片段,根据问题选择画面、音频或转录文本,面对快速动作还能自动提高帧率复核。
核心数据:Google自测Gemini 3.7 Flash开启该功能后,Token消耗最高降88%,分析成本最高降66%,准确率相对提升约7%。模型能精准定位不到1秒的瞬间,也可在数小时视频中检索细节。
技术原理:将开发者以往需自行搭建的「先定位、再精看」流程内置于Gemini。现支持Gemini 3.7 Flash、3.6 Flash及3.5 Flash-Lite,兼容上传视频与YouTube链接,且不额外收费。未来将接入Gemini App与YouTube的Ask YouTube。