谷歌为 Gemini Flash 系列上线“智能体视频理解”:更高准确率,更低推理成本

谷歌为 Gemini Flash 系列模型推出“智能体视频理解”功能,通过主动检索视频片段、音频和转录文本,提升视频分析准确率并降低 Token 消耗。

谷歌宣布在最新的 Gemini 3.7 Flash、Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 模型中推出“智能体视频理解”(agentic video understanding)功能。该能力面向视频分析场景,目标是在提升准确率的同时,显著减少模型处理视频时消耗的 Token 数量与推理成本。

从固定抽帧到主动检索

在传统静态处理方式下,模型通常按固定帧率读取视频。Gemini 的默认设置为每秒 1 帧,开发者也可以通过 API 调整抽帧频率。但这种方式的局限很明显:要么提高帧率、增加 Token 消耗,要么降低帧率、可能错过关键画面。

智能体视频理解改变了这一流程。它将 Gemini 的核心推理能力与原生视频工具结合,使模型能够在视觉帧、音频和转录文本之间动态搜索、扫描并检查目标片段。换句话说,模型不再被动接收固定间隔的视频帧,而是根据任务主动判断需要观看哪些内容、以什么速度观看,以及通过哪种模态获取信息。

  • 模型可以主动选择视频中的相关片段,而不是处理全部固定帧。
  • 模型可结合画面、音频和转录文本进行判断。
  • 原本需要开发者手动实现的检索和筛选流程,可由模型通过智能循环完成。

谷歌称,在标准视频分析基准测试中,启用智能体视频理解后,Gemini 模型可将分析成本降低最高 66%,Token 消耗量降低最高 88%,同时将准确率提升最高 7%。这类提升在长视频场景中更为突出,因为长时间视频往往会让开发者在高成本与细节丢失之间做取舍。

长视频处理成为主要受益方向

谷歌将这项功能视为处理长视频内容的重要工具。相比一次性读取整段视频,智能体式处理更适合需要定位、检索和异常检查的任务。

目前展示的能力包括亚秒级时刻检索,即精准定位在 1 FPS 抽帧下容易被错过的瞬间状态变化和紧凑剪辑边界。这一能力可用于自动化视频编辑等场景。

另一项典型应用是长视频“大海捞针”式搜索。模型可以在数小时长度的视频中回答复杂查询,而不需要消耗数百万 Token。此外,该功能还支持异常检测:当模型发现某个时间窗口值得关注时,可以对该片段以更高帧率重新采样,进一步检查快速运动或细微视觉异常。

在动作与物体计数任务中,模型也可以随时间推移跟踪重复物理动作和不同物体。这类能力对体育视频、监控画面、教学内容和长视频素材分析都有潜在价值。

定价不变,开发者可通过 API 启用

该功能使用标准 Gemini API Token 定价,不收取额外功能费用。开发者可以在 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 中使用,支持视频上传和 YouTube 视频分析。启用方式是在 API 配置中将处理模式设置为“agentic”。

谷歌表示,Gemini 3.7 Flash 与智能体视频理解结合后,可在整体质量与成本效率之间达到较优平衡。在视频理解任务中,该组合位于准确率与成本的帕累托最优前沿。

除开发者工具外,谷歌还计划将这项能力推广到更多面向普通用户的产品。该功能将很快向 Gemini 应用中所有 Flash 和 Flash-Lite 模型用户推送。未来几个月内,智能体视频理解还将为 YouTube 视频观看页的“Ask YouTube”功能提供支持,使系统能够基于视频画面给出更高质量的回答。

原创文章,作者:点点,如若转载,请注明出处:https://www.dian8dian.com/gu-ge-wei-gemini-flash-xi-lie-shang-xian-zhi-neng-ti-shi

Like (0)
点点的头像点点
Previous 16小时前
Next 3小时前

相关推荐