Gemini 推出智能体视频理解,Token 消耗最高降 88%
9 月 2 日,Google DeepMind 宣布为最新 Gemini 模型与 Gemini API 引入「智能体视频理解」能力:模型不再以固定方式处理整段视频,而是根据 prompt 动态决定观看哪些内容、以何种速度(自适应帧率)以及结合哪些信号(转写文本、音频、帧内容)进行分析,在保持视频理解 SOTA 表现的同时显著降低开销。
已确认
- 官方数据显示,该功能可将视频分析成本降低最高 66%,Token 消耗减少最高 88%,准确率提升最高 7%(@rseroter、@patloeber 等转述)。
- @OfficialLoganK 介绍,该功能以「Agentic Video」之名落地于 Gemini API,可在 API 中轻松控制,并已支持 3.7 Flash 等模型;Google 同日发布官方博客文章详解该长视频处理新方式。
- @gaganghotra 补充适用模型口径:Google Cloud 宣布该功能覆盖 Gemini 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite。
- @osanseviero 转述了工作机制:不再固定花 20 万 token 处理长视频,而是智能调用工具(分析转写文本、自适应调整 FPS 等),token 消耗减少 88%,延迟也得到改善;官方同步发布了开发者指南帮助快速上手。
- @AIAndrew(转发)补充 API 用法细节:将 Video processing 模式设为 "agentic" 后即可启用,原生视频工具可智能导航时间轴、查看转录稿并调整帧率。
尚未确认
- 帖子中同时出现「Gemini 1.5 Flash / 1.5 Flash-8B / 1.5 Flash-Lite」(@Scobleizer 转发转述)与「Gemini 3.7 Flash / 3.6 Flash / 3.5 Flash-Lite」(@gaganghotra、@SabooShubham、@OfficialLoganK)两种模型口径,官方首发与适用模型版本以 @GoogleDeepMind 官方公告为准。
为什么重要
- 视频是多模态应用中 Token 消耗最大的形态之一,接近九成的 Token 节省意味着长视频理解类智能体与视频原生 AI 产品的可行性和经济性显著提升,配合 API 级开关和开发指南,开发者可以低成本快速接入这一能力。
2026-09-02 ~ 2026-09-02 · 14 条相关
一手来源
- Gemini 新增智能体视频理解:Token 消耗降 88% — GoogleDeepMind ·
- Gemini API 推出 Agentic Video,降本 88% 提质 — OfficialLoganK ·
- Gemini 支持智能体式视频理解:token 消耗降低 88% — osanseviero ·
- Google 发布 Gemini 3.7 Flash:视频理解成本更低精度更高 — Saboo_Shubham_ · 2026-09-02
- Gemini 3.7 Flash 上线 Agentic Video:更少 token、更高精度 — Saboo_Shubham_ · 2026-09-02
- Gemini 代理视频理解降本 66%,Token 消耗减 88% — rseroter · 2026-09-02
- 【源头】Gemini 新增智能体视频理解:Token 消耗降 88% — GoogleDeepMind · 2026-09-02
- Gemini 推出 Agentic Video Understanding — Scobleizer · 2026-09-02
- 【源头】Gemini 支持智能体式视频理解:token 消耗降低 88% — osanseviero · 2026-09-02
- Gemini 智能体式视频理解上线,开发者指南已发布 — osanseviero · 2026-09-02
- 【源头】Gemini API 推出 Agentic Video,降本 88% 提质 — OfficialLoganK · 2026-09-02
- Google 博客详解 Agentic Video:长视频处理技术 — OfficialLoganK · 2026-09-02
- Gemini 推出代理式视频理解,Token 降 88% — AI_Andrew · 2026-09-02
- 谷歌推出 Agentic Video:Gemini 视频理解 token 省最多 88%、成本降 66% — gaganghotra_ · 2026-09-02
另有 3 条近重复转述:haider1 · patloeber · gaganghotra_