Google DeepMind uruchomił agentic video understanding w trzech modelach Gemini Flash. Rozwiązanie pozwala modelowi samodzielnie decydować, które fragmenty filmu analizować, zamiast przetwarzać wszystko naraz.

TL;DR

  • Funkcja dostępna od 1 września 2026 w Gemini 3.7 Flash, 3.6 Flash i 3.5 Flash-Lite
  • Redukcja zużycia tokenów do 88%, kosztów do 66%, wzrost dokładności do 7%
  • Działa z uploadami wideo i filmami z YouTube przez Gemini API
  • Największe korzyści przy długich materiałach – od 10 minut do kilku godzin
  • Dostępne w Google AI Studio i Gemini Enterprise Agent Platform bez dodatkowych opłat

Jak działa agentic video understanding w Gemini?

Zamiast statycznego pobierania klatek z stałą prędkością (domyślnie 1 FPS), model Gemini teraz aktywnie wybiera, co i jak szybko oglądać. Wykorzystuje do tego natywne narzędzia do klatek, audio i transkryptów.

Rohan Doshi, Senior Product Manager w Google DeepMind, oraz Mario Lučić, Research Director w Google DeepMind, opisali mechanizm w oficjalnym ogłoszeniu z 1 września 2026. Model sam inicjuje pętlę agentyczną i ładuje tylko potrzebne fragmenty pliku wideo.

Liczby, które pokazują skalę oszczędności

Na standardowych benchmarkach analizy wideo modele z nową funkcją zużywają do 88% mniej tokenów i kosztują do 66% mniej przy jednoczesnym wzroście dokładności o maksymalnie 7%.

Największe zyski widać przy długich materiałach – od 10-minutowych poradników po 90-minutowe wykłady i wielogodzinne nagrania. Tam statyczne przetwarzanie zmusza deweloperów do wyboru między wysokimi kosztami a utratą szczegółów.

Gdzie i jak skorzystać z nowej funkcji?

Agentic video understanding jest dostępne od razu dla uploadów wideo i filmów z YouTube przez Gemini API w Google AI Studio oraz Gemini Enterprise Agent Platform. Wystarczy ustawić parametr przetwarzania na „agentic”.

Funkcja korzysta ze standardowego cennika tokenów Gemini – nie ma dodatkowej opłaty. W najbliższych miesiącach ma trafić też do aplikacji Gemini dla zwykłych użytkowników na modelach Flash i Flash-Lite.

Kontekst szerszej strategii Google z agentami

To kolejny krok w kierunku agentów zamiast prostych chatbotów. Google stawia na agentów zamiast chatbotów już od kilku miesięcy, a agentic video understanding to naturalne rozszerzenie wcześniejszych eksperymentów z agentic vision.

Podobne podejście widać też w innych modelach Flash – Google wypuściło Gemini 3.1 Flash-Lite, które mocno obniżyło koszty przy zachowaniu wysokiej wydajności.

Najczęściej zadawane pytania