Agenci AI

Gemini 3.8 Live dla produkcyjnych agentów głosowych

Google udostępnił dwa modele speech-to-speech, które prowadzą rozmowę, analizują obraz i korzystają z narzędzi bez przerywania odpowiedzi głosowej.

Redakcja Zespół redakcyjny 5 min czytania
Konsultant korzystający z głosowego asystenta podczas obsługi klienta
Zdjęcie: Bryan Geraldo / Pexels (pexels.com/photo/greyscale-photo-of-microphone-586416)

Czego się dowiesz

  • Czym różnią się Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking
  • Jak modele prowadzą rozmowę podczas korzystania z API i narzędzi
  • Jakie wyniki osiągnęły w testach agentów głosowych
  • Ile kosztuje przetwarzanie wejściowego i wyjściowego dźwięku
  • Jakie informacje wdrożeniowe nie zostały podane w źródle

Google wprowadził Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking, dwa modele do budowania agentów głosowych działających w czasie rzeczywistym. W dniu publikacji, 15 września 2026 r., oba były dostępne do zastosowań produkcyjnych przez Gemini Live API i Google AI Studio. Najważniejszą zmianą jest możliwość prowadzenia rozmowy podczas wykonywania wywołań API, korzystania z narzędzi i realizowania zadań wymagających kilku kroków.

Jak różnią się dwa modele Gemini 3.8 Live

Oba modele są natywnymi systemami speech-to-speech, czyli bezpośrednio przetwarzają wypowiedź i generują odpowiedź głosową. Należą do rodziny Gemini Audio, którą Google rozszerzył wcześniej o Gemini 3.5 Transcribe. Firma przedstawia nowe modele jako prostszą alternatywę dla potoków łączących automatyczne rozpoznawanie mowy (ASR), model językowy i syntezę mowy (TTS).

Gemini 3.8 Live ma obsługiwać wdrożenia wymagające dużej skali i kontroli kosztów. Łączy prowadzenie płynnego dialogu z analizą kontekstu wizualnego, dzięki czemu agent może uwzględniać zarówno wypowiedź użytkownika, jak i przekazywany obraz. Źródło nie podaje jednak limitów równoczesnych sesji ani parametrów opóźnienia.

Gemini 3.8 Live Extended Thinking jest przeznaczony do bardziej złożonych zadań. Model ma prowadzić rozumowanie wieloetapowe podczas rozmowy i wykonywać działania w tle, nie czekając z odpowiedzią głosową na zakończenie całego procesu. Oba warianty są usługami hostowanymi. Google nie udostępnia otwartych wag ani możliwości uruchomienia ich we własnej infrastrukturze.

Co nowe modele potrafią zrobić przez Live API

Live API udostępnia pięć głównych funkcji, które mają ułatwiać tworzenie agentów obsługujących rozmowę i proces biznesowy w jednej sesji:

  • Asynchroniczne wywoływanie funkcji pozwala uruchamiać interfejsy API i narzędzia w tle. Model nadal przesyła użytkownikowi dźwięk, gdy zewnętrzne zadanie nie zostało jeszcze zakończone.
  • Kontekst wizualny umożliwia przetwarzanie obrazu na żywo w czasie zbliżonym do rzeczywistego. Agent może łączyć informacje widoczne na obrazie z treścią wypowiedzi użytkownika.
  • Precyzja alfanumeryczna ma poprawiać odczytywanie kodów potwierdzających, numerów roszczeń i danych technicznych. Są to informacje, przy których pomyłka pojedynczego znaku może zmienić wynik operacji.
  • Obsługa wielu języków obejmuje 97 języków. Model automatycznie wykrywa zmianę języka w trakcie rozmowy i ma zachowywać spójność akcentu podczas przełączania.
  • Przyrostowe aktualizowanie treści łączy napływający dźwięk z danymi strukturalnymi. Odpowiedź może dzięki temu uwzględniać informacje dostarczane agentowi podczas trwającej sesji.

Takie połączenie funkcji odpowiada na problem występujący w agentach, które muszą przerwać wypowiedź, aby poczekać na wynik z systemu zewnętrznego. W modelach Gemini 3.8 Live strumieniowanie odpowiedzi głosowej może trwać równolegle z wywołaniem narzędzia. Materiał nie opisuje jednak sposobu obsługi błędów, ponawiania żądań ani kontroli uprawnień do poszczególnych funkcji.

Jak Extended Thinking prowadzi zadania wieloetapowe

Gemini 3.8 Live Extended Thinking dodaje konfigurowalny tryb rozumowania przeznaczony do dłuższych procesów. Model może potwierdzić przyjęcie polecenia krótkim komunikatem, a następnie informować głosowo o postępie, gdy w tle realizuje kolejne kroki. Ma to ograniczać ciszę, która podczas rozmowy mogłaby zostać odebrana jako zerwanie połączenia albo błąd aplikacji.

Google pokazał między innymi demonstrację, w której model przekształcał szkic i przekazywane głosem uwagi w działający komponent React. Drugi przykład dotyczył koordynowania rezerwacji wymagającej wykonania wielu następujących po sobie operacji. Materiał źródłowy nie podaje czasu realizacji tych zadań ani informacji, czy demonstracje korzystały z dodatkowych zabezpieczeń lub przygotowanych wcześniej integracji.

Extended Thinking nie oznacza osobnego modelu instalowanego lokalnie. Funkcja działa w usłudze Google, a źródło nie opisuje dostępnych parametrów konfiguracji rozumowania. Zespoły wdrożeniowe muszą więc sprawdzić dokumentację Live API, aby ustalić sposób kontrolowania czasu odpowiedzi, użycia narzędzi i zachowania modelu podczas długich operacji.

Jak modele wypadły w testach agentów głosowych

Według wyników przytoczonych w materiale Gemini 3.8 Live Extended Thinking zajął pierwsze miejsce w Speech to Speech Quality Index organizacji Artificial Analysis. Model uzyskał 82,6 punktu. W testach dotyczących wykonywania zadań osiągnął 68,6 proc. w τ-Voice oraz 35,1 proc. w benchmarku Sierra τ-Voice-banking.

W Big Bench Audio, który sprawdza rozumowanie modeli na podstawie dźwięku, Extended Thinking osiągnął 97,7 proc. Podstawowy Gemini 3.8 Live zajął natomiast drugie miejsce w Speech Agent Arena, gdzie odpowiedzi oceniają ludzie. Źródło nie podaje liczby ocen, zestawu porównywanych modeli ani szczegółowej metodologii tego badania preferencji.

Google informuje również o wynikach w EVA-Bench firmy ServiceNow. Według firmy oba modele przesuwają granicę Pareto dla złożonych przepływów, łącząc dokładność wykonania zadania z jakością rozmowy. Pomiar przeprowadzono przez Live API na Gemini Enterprise Agent Platform, ale w materiale nie ma szczegółowych rezultatów liczbowych. Wyniki benchmarków pokazują deklarowane możliwości modeli, nie zastępują jednak testów na danych i procesach właściwych dla konkretnego wdrożenia.

Ile kosztuje dostęp i jak można go zintegrować

Cena obu modeli wynosi 0,005 USD za minutę wejściowego dźwięku oraz 0,018 USD za minutę dźwięku wygenerowanego. Google podaje, że szacunek opiera się na stawkach 3 USD za 1 mln tokenów wejściowych i 12 USD za 1 mln tokenów wyjściowych. Źródło nie informuje o rabatach wolumenowych, dodatkowych kosztach narzędzi ani warunkach rozliczania przerw i ciszy w sesji.

Poza bezpośrednim użyciem Live API deweloperzy mogą skorzystać z partnerów zapewniających infrastrukturę do strumieniowania multimediów w czasie rzeczywistym. Wymieniono Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel i Vision Agents. Google współpracuje także z Salesforce, Genspark oraz Lumeris, a przykładowe aplikacje zostały udostępnione na GitHubie.

Każdy dźwięk wygenerowany przez modele otrzymuje niewidoczny dla odbiorcy znak wodny SynthID opracowany przez Google DeepMind. Materiał nie opisuje sposobu wykrywania tego oznaczenia przez klientów ani zasad jego zachowania po kompresji i dalszej obróbce nagrania.

Dla firm w Polsce obsługa 97 języków może być istotna przy projektowaniu jednego agenta dla kilku rynków, ale źródło nie publikuje pełnej listy i nie potwierdza wprost parametrów języka polskiego. Przed pilotażem trzeba też sprawdzić w dokumentacji regiony dostępności, zasady przechowywania danych, limity API i poziom wsparcia, ponieważ tych informacji nie ma w opisywanym materiale.

Czy ten artykuł był pomocny?

Jeden głos na artykuł. Możesz go zmienić albo wycofać ponownym kliknięciem - Twój wybór zapamiętujemy w tej przeglądarce.

Redakcja

Zespół redakcyjny portalu. Piszemy i redagujemy teksty, weryfikujemy zgłoszenia od autorów i pilnujemy, żeby definicje w słowniku były aktualne.

Wszystkie artykuły autora →

Agenci AI

OpenAI wstrzymuje trening modeli po awarii zabezpieczeń

Firma zawiesiła trening, ewaluacje i pracę najbardziej zaawansowanych modeli z narzędziami. Decyzję podjęła po niedozwolonym połączeniu zewnętrznym i awarii automatycznego zatrzymania.

Redakcja 5 min czytania
Agenci AI

Luka zero-day w Muse daje kontrolę nad kontem agenta AI

Badacz Patrick Wardle wykazał, że lokalna aplikacja lub polecenie terminala może przejąć token Muse. Luka pozwala wykorzystać szerokie uprawnienia agenta na macOS.