摘要由 AI 生成
Google 于 2026 年 9 月 5 日在 Gemini Flash 模型中发布代理视频理解功能。该功能允许模型自主决定观看时机、帧率及模态,替代传统固定处理模式,使视频 token 减少高达 88%,成本降低 66%,并在标准基准测试上准确率提升 7%。目前该功能仅作为托管 API 提供,不支持开源权重,需通过 Google AI Studio 和 Gemini Enterprise Agent Platform 调用,支持文件上传及公开 YouTube 链接。此特性适用于 Gemini 3.8、3.7、3.6 Flash 及 3.5 Flash-Lite 模型,旨在提升长内容视频分析效率。
关键实体KEY ENTITIES
Gemini APIGemini Enterprise Agent PlatformGemini FlashGoogleGoogle AI Studio
事件框架EVENT FRAME
产品发布
Google
Agentic Video Understanding
Gemini Flash 模型新增视频理解功能,减少 Token 使用
报道态势 · 每日报道量LANGUAGE SPLIT
实体关系
信号强度SIGNALS
关键词热度
- Google1
- Gemini Flash1
- Gemini API1
- Google AI Studio1
- Gemini Enterprise Agent Platform1
全部报道(1)SOURCES
↗
Google 本周在 Gemini Flash 模型中推出代理视频理解功能,使视频 token 减少高达 88%、成本降低 66%,并在标准基准测试上准确率提升 7%。该功能通过让模型自主决定观看时机、帧率及模态来替代传统的固定 1 帧/秒单次处理,仅按需加载所需内容。此特性目前仅作为托管 API 提供,不支持开源权重,需通过 Google AI Studio 和 Gemini Enterprise Agent Platform 调用,支持文件上传及公开 YouTube 链接。与静态处理相比,代理模式将视频分析效率集中于长内容(如 10 分钟教程或多小时录像),并在响应中增加处理调用与结果步骤以支持进度追踪。该功能适用于 Gemini 3.8、3.7、3.6 Flash 及 3.5 Flash-Lite 模型…