Firma SpaceXAI udostępniła Grok Voice Transcribe 2.0, model zamieniający mowę na tekst, przeznaczony między innymi do nagrań z hałasem, rozmów telefonicznych, lokalnych akcentów i wypowiadanych danych kontaktowych. Według dostawcy nowa wersja osiąga dwukrotnie wyższą dokładność niż Grok Voice Transcribe 1.0, zachowując te same ceny. Wyniki wewnętrzne nie zostały jednak niezależnie odtworzone.
Czym jest Grok Voice Transcribe 2.0
Model działa w trybie wsadowym oraz jako transkrypcja strumieniowa w czasie rzeczywistym. SpaceXAI udostępnia go przez Speech to Text API pod identyfikatorem grok-voice-transcribe-2.0. Według publikacji z 19 września 2026 r. usługa jest już aktywna, ale podczas integracji trzeba wskazać nowy identyfikator modelu.
Grok Voice Transcribe 2.0 jest usługą hostowaną przez dostawcę. SpaceXAI nie zapowiedziało publikacji otwartych wag, dlatego firmy nie mogą obecnie uruchomić modelu na własnej infrastrukturze. Dotyczy to zarówno lokalnych serwerów, jak i prywatnej chmury zarządzanej samodzielnie przez użytkownika.
Technologiczną podstawę rozwiązania stanowi model audio używany przez Grok Voice. SpaceXAI podaje, że ta technologia obsługuje dziesiątki tysięcy połączeń z klientami dziennie, transkrybuje miliony godzin narracji wideo i wspiera asystenta Grok w samochodach Tesla. Dane treningowe obejmowały rzeczywiste, zaszumione i wielojęzyczne nagrania z różnych środowisk, a później model przeszedł dodatkowe dostrajanie.
Jak model wypada w testach dostawcy
SpaceXAI informuje, że Grok Voice Transcribe 2.0 zajął pierwsze miejsce wśród 32 modeli strumieniowych w publicznym rankingu Artificial Analysis. Użyty tam test AA-WER Streaming obejmuje około 8 godzin materiału audio. Na wynik składają się AA-AgentTalk z wagą 50 proc., VoxPopuli z wagą 25 proc. oraz Earnings22 z wagą 25 proc.
Dostawca przeprowadził również własne testy na 4 zestawach pochodzących z ruchu produkcyjnego. Obejmowały anglojęzyczne rozmowy z obsługi klienta nagrane w telefonicznej jakości 8 kHz, konwersacje użytkowników z Grok, wypowiadane numery telefonów, adresy poczty elektronicznej i adresy fizyczne, a także krótkie polecenia w 19 językach.
Według SpaceXAI wersja 2.0 uzyskała niższy współczynnik błędów słów WER na każdym z 4 zbiorów niż wersja 1.0. W kategorii połączeń telefonicznych miała wyprzedzić wszystkie modele sprawdzone przez firmę. Są to wyniki raportowane przez producenta, a materiał źródłowy nie podaje niezależnego badania na tych samych danych produkcyjnych.
Co zmieniło się w obsłudze wielu języków
Model automatycznie wykrywa język i transkrybuje nagrania w dziesiątkach języków. Potrafi też śledzić zmianę języka w trakcie jednej wypowiedzi bez dzielenia pliku na osobne fragmenty. SpaceXAI określa poprawę jakości wielojęzycznej transkrypcji jako największą zmianę względem Grok Voice Transcribe 1.0.
Najbardziej konkretny wynik dotyczy krótkich poleceń głosowych w 19 językach. W tym teście WER spadł z 20,6 proc. do 6,8 proc., co odpowiada ograniczeniu liczby błędnie rozpoznanych słów o około 67 proc. Krótkie komunikaty są trudniejsze do klasyfikacji, ponieważ model otrzymuje niewiele kontekstu potrzebnego do rozpoznania języka.
Dokumentacja wymienia również 25 języków, dla których API zapisuje liczby, waluty i jednostki w formie pisemnej. Materiał nie przedstawia jednak osobnego wyniku WER dla języka polskiego ani nie precyzuje, czy polszczyzna należy do wszystkich wymienionych grup obsługi.
Jakie funkcje oferuje Speech to Text API
SpaceXAI udostępnia funkcje przetwarzania nagrań i strumieni audio w ramach jednego API. Zakres usługi obejmuje:
- Tryb wsadowy i strumieniowy, czyli transkrypcję plików, materiałów wskazanych adresem URL oraz dźwięku przesyłanego przez WebSocket.
- Znaczniki czasu dla każdego słowa, obejmujące czas rozpoczęcia, czas zakończenia oraz wynik pewności rozpoznania.
- Diaryzację mówców, która przypisuje fragmenty transkrypcji do poszczególnych rozmówców bez dodatkowej opłaty.
- Transkrypcję wielokanałową, obsługującą do 8 kanałów audio przetwarzanych niezależnie.
- Preferowanie terminów branżowych, z limitem 100 wskazanych pojęć na żądanie i 50 znaków dla każdego terminu.
- Formatowanie tekstu, obejmujące liczby, daty, waluty, numery telefonów i adresy poczty elektronicznej.
- Usuwanie wypełniaczy, takich jak angielskie um i uh, domyślnie pomijanych w zwracanym tekście.
- Wykrywanie końca wypowiedzi, w którym model uczenia maszynowego określa moment przejęcia kolejki przez agenta głosowego.
Punkt końcowy dla przetwarzania wsadowego przyjmuje pliki o rozmiarze do 500 MB w 12 formatach audio. Transkrypcja strumieniowa działa pod adresem wss://api.x.ai/v1/stt. W tym trybie API obsługuje również kodek Opus, wymagający według dostawcy około 4 KB/s, podczas gdy surowy dźwięk PCM przy częstotliwości 24 kHz wymaga około 48 KB/s.
Połączenie znaczników czasu, diaryzacji i preferowania terminów może przydać się w transkrypcji rozmów z klientami oraz nagrań zawierających specjalistyczne słownictwo. Z kolei wykrywanie końca wypowiedzi jest przeznaczone dla agentów głosowych, którzy muszą zdecydować, kiedy odpowiedzieć rozmówcy.
Ile kosztuje usługa i jak korzysta z niej Loom
Cennik nie zmienił się względem Grok Voice Transcribe 1.0. Transkrypcja wsadowa kosztuje 0,10 USD za godzinę audio, a strumieniowa 0,20 USD za godzinę. Odpowiada to odpowiednio około 1,67 USD i 3,33 USD za 1000 minut. Diaryzacja, znaczniki czasu oraz obsługa wskazanych terminów są zawarte w cenie.
Jednym z opisanych wdrożeń jest Atlassian Loom, który używa Grok Voice Transcribe 2.0 do transkrybowania każdego wideo. Atlassian uznał model za dokładniejszy od wcześniej używanego rozwiązania, ale materiał nie zawiera liczbowego porównania. Przedstawiony przepływ obejmuje nagranie planu działania w Loom, przekazanie transkrypcji do Cursor i wprowadzenie przez to narzędzie zmian w kodzie.
Dla firm w Polsce hostowane API oznacza możliwość włączenia transkrypcji do procesów obsługi klienta, analizy nagrań lub agentów głosowych bez uruchamiania własnego modelu. Przed wdrożeniem trzeba jednak sprawdzić jakość języka polskiego na reprezentatywnych nagraniach, ponieważ źródło nie podaje osobnego wyniku dla polszczyzny.
