Gemini learns to 'watch' video selectively: 88% fewer tokens, 66% lower cost

mfckr_eth · x · 2026-09-02

Google's Gemini no longer processes video frame by frame — it can skip around, search transcripts, rewind and zoom into key moments. Result: up to 88% fewer tokens, 66% lower cost, and up to 7% better accuracy. Models are learning when NOT to think about something.

Related event: Google DeepMind launches Agentic Video Understanding for Gemini, cutting token use by up to 88%(22 posts)→

Original post →

More from Models

Models channel →