Google DeepMind dorzuciło do rodziny Gemini dwa modele, które celują w jeden dość konkretny problem: rozmowy głosowe z AI mają brzmieć naturalniej i kosztować mniej. Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking mają pomóc firmom budować agentów, którzy nie gubią wątku przy dłuższej rozmowie i potrafią działać w tle, zamiast tylko ładnie mówić.

TL;DR

  • Gemini 3.8 Live i Extended Thinking to nowe modele do głosowych agentów AI od Google DeepMind
  • Extended Thinking osiągnął 82.6 na Artificial Analysis Speech to Speech Quality Index
  • Modele wspierają równoczesne rozumowanie, wywołanie narzędzi w tle i 97 języków
  • Google podaje cenę od 0,005 USD za minutę wejścia audio
  • Modele są dostępne w Gemini API, Google AI Studio oraz w wybranych produktach Google

Co Google DeepMind ogłosiło 15 września 2026?

15 września 2026 roku Google DeepMind zaprezentowało dwa modele: Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking. Pierwszy ma być nastawiony na skalę i koszt, drugi dokłada wieloetapowe rozumowanie przy bardziej złożonych zadaniach głosowych.

Według opisu Google oba modele pozwalają prowadzić rozmowę i równolegle wykonywać akcje w tle, na przykład wywołania API. Obsługują też automatyczne przełączanie między 97 językami w trakcie jednej rozmowy, co dla zespołów budujących infolinie czy asystentów głosowych może być ważniejsze niż kolejny efektowny benchmark.

Jak Gemini 3.8 Live wypada w benchmarkach i cenie?

Gemini 3.8 Live Extended Thinking osiągnął wynik 82.6 w rankingu Speech to Speech Quality Index przygotowywanym przez Artificial Analysis — tak wynika z przywołanych w tekście doniesień The Decoder. W tych samych doniesieniach pojawiają się też wyniki 68.6% na τ-Voice i 35.1% na Sierra τ-Voice-banking, czyli testach sprawdzających bardziej „agentyczne” użycie modelu.

Jeśli chodzi o koszt, Google podaje stawkę 0,005 USD za minutę wejścia audio. The Decoder wylicza na tej podstawie, że godzina rozmowy może kosztować około 1,38 USD, podczas gdy GPT-Live-1 od OpenAI ma zaczynać się od 3 USD za godzinę. To jeszcze nie rozstrzyga, kto ma lepszy model, ale dla firm liczących rachunek za tysiące połączeń różnica jest już bardzo konkretna.

Gdzie Google już wdraża Gemini 3.8 Live?

Google nie zostawiło tych modeli wyłącznie w API. Gemini 3.8 Live ma już zasilać Search Live w aplikacji Google, a Extended Thinking trafia także do części funkcji w Gmailu, Docs i Keep dla użytkowników planów AI Pro oraz Ultra. To ważny sygnał, bo pokazuje, że firma testuje te modele nie tylko na deweloperach, ale też na własnych produktach konsumenckich i biurowych.

Po stronie twórców oprogramowania modele są dostępne w Gemini API i Google AI Studio. Google wskazuje też na integracje z narzędziami takimi jak LiveKit, LangChain i Vercel. To pasuje do szerszego ruchu firmy: od miesięcy mocniej pcha Gemini w stronę agentów wykonujących zadania, a nie samych chatbotów. Zobacz: Google stawia na agentów zamiast chatbotów oraz tańsze warianty Gemini 3.1 Flash-Lite.

Co Gemini 3.8 Live zmienia na rynku voice AI?

Najciekawsze w tej premierze nie jest samo „AI do głosu”, bo to już nikogo specjalnie nie szokuje. Ciekawsza jest próba zbicia kosztu przy jednoczesnym utrzymaniu rozmowy i działań w tle. Tu idzie gra o contact center, asystentów zakupowych i narzędzia dla firm, które nie chcą płacić za każdą minutę jak za konsultanta premium.

Google twierdzi, że modele są gotowe do użycia produkcyjnego, ale rynek pewnie jeszcze sprawdzi, czy niższa cena nie odbija się na jakości dialogu. W tle wciąż jest też OpenAI, które bywa chwalone za naturalność rozmowy w trybie full-duplex. Dla polskich firm to może być jednak prostszy próg wejścia: nawet przy kursie rzędu 4 zł za dolara mówimy o koszcie liczonym w groszach za minutę wejścia audio, więc eksperymenty z głosowym interfejsem przestają być zabawką tylko dla największych.

Najczęściej zadawane pytania