Gemini 推出 Agentic Video:长视频理解省 88% token 还更准

davidstutz92 · x · 2026-09-04

Google DeepMind 官方(Logan Kilpatrick)宣布 Gemini API 推出 Agentic Video 长视频处理方式:token 消耗最高降低 88%,同时质量反而提升,可在 API 中按视频粒度控制,已支持 3.7 Flash 等最新模型。第三方转述称其在长视频推理基准 Minerva 上准确率提升 5.3 个百分点,且只用了 42% 的 token 成本。相关评测基于 DeepMind 开源的 Minerva 数据集集合,其中 Minerva-cultural 包含 540 个文化多语种视频、约 2200 条专家人工撰写问答对,专门测试 Video-LLM 的跨文化长视频推理能力。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →