Gemini最新模型推出Agent式视频理解功能
原文:Introducing agentic video understanding with Gemini
今天,我们在最新模型 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 上推出智能体视频理解(agentic video understanding)功能。这一新能力提升了准确性,同时大幅降低了视频分析的 token 消耗和成本。与结合代码执行与 Gemini 模型原生图像理解的 agentic vision 类似,智能体视频理解利用 Gemini 的原生视频工具来提升性能,并为视频处理解锁新能力,例如亚秒级时刻检索、更精确的异常检测、精准计数等。该功能即日起可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 中的 Gemini API 用于视频上传和 YouTube 视频。基准测试与目前以固定帧率(默认 1 FPS,可通过 API 调整)读取视频的"静态"处理方式不同,智能体视频理解将模型的核心推理能力与原生视频工具相结合,跨视觉帧、音频和转录文本动态搜索、扫描和检查目标视频片段。在标准视频分析基准测试中,启用智能体视频理解的 Gemini 模型可将分析成本最多降低 66%,token 消耗最多降低 88%,同时将准确性最多提升 7%。这些效率提升在长视频上尤为显著(从 10 分钟的操作指南到 90 分钟的讲座以及数小时的录像),因为静态处理迫使开发者在高昂的 token 成本与丢失关键细节的技术之间做取舍。在 Gemini 3.7 Flash 上启用智能体视频理解可将 token 消耗最多降低 88%,准确性最多提升 7%。虽然这些提升覆盖全部三款支持的模型,但搭载智能体理解的 Gemini 3.7 Flash 在整体质量以及质量与成本效率的组合上表现最佳,在测试过的视频理解模型中处于准确性与成本的帕累托前沿。