Google spustil agentní porozumění videu pro modely Gemini 3.7 Flash, 3.6 Flash a 3.5 Flash-Lite. Místo zpracování celého záznamu pevnou snímkovou frekvencí si model podle cíle dynamicky vybírá úseky, snímky, zvuk nebo přepis, které potřebuje pro odpověď. Funkce má pomoci při hledání krátkých okamžiků v dlouhých videích, počítání opakovaných pohybů, odhalování anomálií a analýze několikahodinových záznamů. Google ve vlastních testech uvádí snížení spotřeby tokenů až o 88 procent, nákladů až o 66 procent a zvýšení přesnosti až o sedm procent. Novinka je dostupná pro nahraná videa i YouTube přes Gemini API v Google AI Studio a platformě Gemini Enterprise Agent Platform. Vývojáři ji zapnou volbou zpracování agentic, bez zvláštního příplatku nad běžné ceny API.