Gemini 推出智能体视频理解,Token 消耗最高降 88%

9 月 2 日,Google DeepMind 宣布为最新 Gemini 模型与 Gemini API 引入「智能体视频理解」能力:模型不再以固定方式处理整段视频,而是根据 prompt 动态决定观看哪些内容、以何种速度(自适应帧率)以及结合哪些信号(转写文本、音频、帧内容)进行分析,在保持视频理解 SOTA 表现的同时显著降低开销。

已确认

尚未确认

为什么重要

2026-09-02 ~ 2026-09-02 · 14 条相关

一手来源

另有 3 条近重复转述:haider1 · patloeber · gaganghotra_