Google DeepMind 1. září 2026 oznámil agentní video understanding pro Gemini, který modelu umožňuje provádět úkony na základě obsahu videa, nejen ho popisovat. Nová schopnost navazuje na srpnové novinky Google a míří na vývojáře pracující s multimediálním obsahem. Podle tiskové zprávy DeepMind nová funkce snižuje spotřebu tokenů až o 88 %, náklady až o 66 % a zlepšuje kvalitu až o 7 %.
Agentní video understanding znamená, že Gemini může sledovat video a na jeho základě autonomně jednat – například extrahovat klíčové momenty, spustit navazující úkol nebo odpovídat na dotazy vztahující se ke konkrétní scéně. Dosud modely video především popisovaly nebo přepisovaly.
DeepMind tuto schopnost prezentuje jako součást širšího srpnového balíku novinek Google pro AI. Přesná dostupnost pro vývojáře ani cenové podmínky nejsou z dodaných podkladů patrné. Schopnost agentního videa doplňuje dřívější Gemini Omni 1.1 Flash zaměřený na generaci videa.
Proč by vás to mělo zajímat
Vývojáři, kteří staví aplikace zpracovávající video obsah, mohou agentní vrstvu využít k automatizaci kroků, které dnes vyžadují ruční anotaci nebo střih. Vyzkoušejte dostupné demo v Google AI Studiu a ověřte, zda schopnost odpovídá vašemu konkrétnímu use case.



