Gemini Agentic 视频理解实测账本:token 省 88%、成本降 66%、精度反升 7%
_philschmid · x · 2026-09-02
Phil Schmid 拆解了 Gemini 的 Agentic 视频理解:模型可迭代地导航视频时间线,自行决定看什么、选帧率(0.1 或 10 FPS),以及是否需要语音转录、音频或视觉帧来回答问题。结果是长视频最多省 88% token、成本降 66%,基准精度还提高约 7%。
工作机制:
- 通过 Files API 或 YouTube 的轻量 URI 引用接收内容并按需加载;
- 先扫描语音转录定位相关时刻,再拉取视觉帧;
- 导航关键时间戳并自选帧率;
- 声学线索重要时直接拉取音轨。
用法:在 video 上设置 processing="agentic" 即可启用;2 分钟以内的视频建议保持 static。目前已面向 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash Lite 开放。
「编程与Agent」频道最新
- 内存占用仅为 rust-analyzer 的百分之一?新 Rust 语言服务器 Rust Glancer 发布 — JeremyCMorgan · 2026-09-02
- 防 Agent 误删文件:Doberman 实现执行层动作网关 — Da_Lil_Fu · 2026-09-02
- Reddit 讨论:AI 智能体当房产开发商,预制房模式可省 30% 房价 — epSos-DE · 2026-09-02
- CommerceAgentBench 破千星:阿里Accio从160万真实对话提炼电商Agent基准 — VibeMarketer_ · 2026-09-02
- Fable 5.1 发布:输出带 Anthropic 统计水印,缓存与工具调用多项改进 — Angaisb_ · 2026-09-02
- 提示与技巧:会话过长会导致 Token 浪费与模型能力下降 — hudsonhateno · 2026-09-02