Google 推出主动视频理解:token 省 88%、成本降 66%、准确率升 7%
APPSO · wechat · 2026-09-03
Google 9 月 1 日为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 三款模型接入「主动视频理解」功能,让 AI 自主决定看哪段画面、以什么速度看、依赖画面/音频还是字幕,告别传统每秒固定抽帧导致瞬态动作被漏掉的问题。开发者此前需写胶水代码手动拼这种逻辑,现由模型原生接管。
- 官方基准:启用后 token 消耗最多降 88%,分析成本最多降 66%,准确率最高提升 7%;LongVideoBench 对比显示 Gemini 3.7 Flash 处于准确率-成本帕累托前沿。
- 可用性:已可通过 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 调用,支持上传视频与 YouTube 视频,沿用标准 token 计费;后续将推送给 Gemini App 全部 Flash 用户,并支持 YouTube 的 AskYouTube 功能。
- 应用想象:文章描绘了直播赛事战术实时拆解、家庭摄像头语义化预警(如「宝宝正在攀爬书柜」)、长视频随问随答等场景。
- 另提及 MrBeast 将在与 Google 合作的新视频中展示 Gemini 辅助探险。
所属事件:Gemini 推出 Agentic Video:token 省 88%、成本降 66%(28 条相关)→
「模型」频道最新
- 网友称 muse 贡献者模式是当前最便宜的高端模型 — philfung · 2026-09-03
- Grok 语音转写全生态打通,用户称长段口述零翻车 — XFreeze · 2026-09-03
- 研究:为性别包容微调 GPT 反而制造了新的单向偏见 — maier_ak · 2026-09-03
- Gemini 3.8 Flash 上线 Cursor,主打顶级性价比 — jocarrasqueira · 2026-09-03
- Anthropic 员工:新能力已上线 API,Claude Code 一两天内跟进 — trq212 · 2026-09-03
- OpenAI 帮助文档悄然更新,Astra 网络安全产品发布在即 — sykip · 2026-09-03