Gemini 推出 Agentic Video Understanding
Scobleizer · x · 2026-09-02
Google 在 Gemini 1.5 Flash、1.5 Flash-8B 和 1.5 Flash-Lite 中推出 Agentic Video Understanding(智能体视频理解)。
该技术允许模型动态决定观看内容、速度及信号来源(帧、音频或文本),而非固定采样率。官方数据显示,这带来了约 88% 的 Token 减少、66% 的成本降低以及 7% 的精度提升。
功能现已通过 Gemini API 提供,并将集成至 Gemini App 和 YouTube 的“Ask YouTube”体验中。
所属事件:Gemini 推出智能体视频理解,Token 消耗最高降 88%(15 条相关)→
「多模态」频道最新
- AI 制作饮料广告:眼球倒影与冷水飞溅特效 — anthara_ai · 2026-09-02
- MiniMax H3 提示词:布光织物片头效果 — umesh_ai · 2026-09-02
- 网友更关注 Meta 实时语音转录模型而非 Fable 5.1 — IndraVahan · 2026-09-02
- Fable 5.1 代码生成视频演示:从地块到建筑漫游 — alexalbert__ · 2026-09-02
- 李飞飞谈世界模型:这是与语言模型根本不同的问题 — drfeifei · 2026-09-02
- World Labs 展示 Atlas 如何连接世界模型与机器人 — drfeifei · 2026-09-02