Badania i newsy

Google rozwija technologie AI dla ponad 300 języków

Google opisuje modele, które przetwarzają mowę bezpośrednio, uwzględniając ton, emocje i zmianę języka. Firma rozwija też otwarte dane oraz rozwiązania działające bez stałego internetu.

Redakcja Zespół redakcyjny 5 min czytania
Osoba korzystająca ze smartfona do tłumaczenia wielojęzycznej rozmowy głosowej
Zdjęcie: Christian Wasserfallen / Pexels (pexels.com/photo/abstimmung-knopf-saal-nationalrat-bundeshaus-14766055)

Czego się dowiesz

  • Jak Gemini ma rozpoznawać ton, emocje i zmianę języka w rozmowie
  • Na czym polega inicjatywa objęcia tysiąca najczęściej używanych języków
  • Jak lokalne społeczności i uczelnie współtworzą dane językowe
  • Jak TranslateGemma, AVA i Sign Language-to-Text mają ograniczać bariery dostępu

Google w materiale datowanym na 15 września 2026 r. przedstawił rozwój technologii językowych opartych na AI. Firma odchodzi od systemów skupionych wyłącznie na tłumaczeniu tekstu i buduje modele, które mają rozpoznawać ton, emocje, kontekst oraz sposób mówienia. Ma to zwiększyć dostępność narzędzi dla języków słabo reprezentowanych w internecie i dla użytkowników bez niezawodnego dostępu do sieci.

Dlaczego transkrypcja nie wystarcza do rozumienia mowy

Technologie i produkty Google obsługują codzienne interakcje w ponad 300 językach, którymi posługuje się przeszło 7 miliardów ludzi, czyli 86 proc. światowej populacji. Jednocześnie tysiące żywych języków i dialektów nadal ma niewielką reprezentację cyfrową. Google Translate, uruchomiony w 2006 r. z obsługą kilku języków, obejmuje obecnie ponad 250.

Klasyczne systemy rozpoznawania mowy najpierw zamieniają nagranie na tekst, następnie analizują zapis, a na końcu ponownie generują dźwięk. Taki ciąg operacji może pomijać tempo wypowiedzi, emocje, wahania i nakładanie się głosów. Trudność sprawiają również zdania łączące kilka języków, na przykład Spanglish lub Hinglish.

Google trenuje modele Gemini tak, aby analizowały dźwięk bezpośrednio i rozpoznawały zarówno jego brzmienie, jak i intencję mówiącego. Gemini 3.5 Live Translate obsługuje tłumaczenie rozmów w czasie rzeczywistym w 70 językach i ponad 2000 parach językowych. System ma uwzględniać emocje oraz przełączanie kodów językowych, czyli zmianę języka w obrębie jednej wypowiedzi.

Gemini 3.5 Transcribe zamienia surowe nagrania w sformatowany tekst, również przy hałasie i specjalistycznej terminologii. Model zasila także funkcję Rambler w Android Gboard. Narzędzie usuwa słowa wypełniające, poprawia gramatykę i interpunkcję, pozwala redagować tekst poleceniami głosowymi oraz przełączać się między językami.

Jak Google chce objąć tysiąc najczęściej używanych języków

Celem 1,000 Languages Initiative jest wsparcie tysiąca najczęściej używanych języków świata. Jedną z podstaw projektu stanowi Universal Speech Model, wytrenowany na 12 milionach godzin nagrań. Google zastosował transfer międzyjęzykowy, dzięki któremu wzorce poznane na językach z dużą liczbą danych mogą poprawiać rozumienie mowy w językach dysponujących znacznie mniejszymi zbiorami treningowymi.

Firma przedstawia te prace jako kontynuację 25 lat otwartych badań oraz ponad 400 recenzowanych publikacji dotyczących mowy. Samo zwiększanie zbiorów nie wystarcza jednak do odwzorowania języka używanego lokalnie. Dane muszą uwzględniać wymowę, rytm rozmowy, warianty tonalne i kontekst kulturowy.

Jak lokalne społeczności tworzą dane dla modeli

Internet zawiera nieproporcjonalnie dużo materiałów w kilku dominujących językach. Google próbuje uzupełniać te braki przez współpracę z uczelniami, ekspertami językowymi i organizacjami działającymi w lokalnych społecznościach.

  • WAXAL, przygotowany między innymi z Makerere University i Digital Umuganda, obejmuje 27 języków Afryki Subsaharyjskiej. Posługuje się nimi ponad 100 milionów osób w przeszło 26 państwach. Otwarty zbiór zapisuje także warianty tonalne i rytm naturalnych rozmów.
  • Project Vaani, realizowany z Indian Institute of Science i Bhashini, gromadzi dane według regionów, a nie wyłącznie według języków. Projekt zebrał ponad 30 tysięcy godzin mowy w 109 językach od przeszło 155 tysięcy osób.
  • Amplify Initiative połączyła ponad 1600 lokalnych ekspertów i 20 uczelni na czterech kontynentach. Wśród partnerów znajdują się UFMG w Brazylii, IIT Kharagpur w Indiach i Makerere University w Ugandzie. Powstało 15 tysięcy multimodalnych punktów danych.

Google udostępnia również Language Explorer, interaktywne narzędzie prezentujące LinguaMeta. Według firmy jest to największe otwarte repozytorium danych językowych na świecie, które mapuje ponad 7000 języków mówionych, pisanych i migowych. Projekt otrzymał wyróżnienie Fast Company za innowację projektową.

Inicjatywy wspierane przez Google.org, w tym Centre for Digital Language Inclusion oraz Project Aquarium prowadzony przez AI Singapore, mają udostępniać narzędzia wielojęzyczne rolnikom, pracownikom ochrony zdrowia i nauczycielom. Źródło nie podaje szczegółowych wyników tych wdrożeń.

Jak narzędzia mają działać bez stałego dostępu do sieci

Ponad 3 miliardy ludzi nie ma niezawodnego dostępu do internetu. Google rozwija z tego powodu TranslateGemma, rodzinę lekkich, otwartych modeli tłumaczeniowych zbudowanych na podstawie Gemini i wytrenowanych w 55 językach. Modele mogą działać na urządzeniu, bez połączenia z chmurą lub internetem.

Takie rozwiązanie nadal wymaga odpowiednio wydajnego sprzętu, którego nie mają setki milionów użytkowników telefonów bez rozbudowanego systemu operacyjnego. Google wspiera więc organizację Viamo rozwijającą Ask Viamo Anything, głosowego asystenta udostępniającego funkcje Gemini na zwykłych telefonach. Pilotaż w Rwandzie wykorzystał istniejący system interaktywnej obsługi głosowej, a usługa odpowiedziała już na ponad 2 miliony pytań.

Osobny kierunek dotyczy osób używających języków migowych. Sign Language-to-Text wytrenowano na ponad 50 takich językach. Technologia zasila dyktowanie z języka migowego w Gboard i Live Transcribe na Pixel 11, początkowo dla tłumaczenia American Sign Language na język angielski. Według Google na świecie około 70 milionów ludzi polega na języku migowym w komunikacji.

Co wielojęzyczna AI może oznaczać dla firm w Polsce

Google rozwija również lokalną wymowę nazw miejsc. W Nowej Zelandii firma współpracowała z ekspertami języka Māori, aby poprawić wymowę nazw w Google Maps. Autentyczne warianty wymowy trafiają bezpośrednio do modeli zamiany tekstu na mowę, co ma ograniczać błędy i lepiej odzwierciedlać lokalne dziedzictwo językowe.

Technologie językowe Google łączą ponad 5 miliardów ludzi na dziewięciu platformach, w tym Search, Android, Chrome, YouTube i Google Play. Dla firm w Polsce rozwój bezpośredniej analizy mowy może oznaczać dokładniejszą transkrypcję wielojęzycznych rozmów, sprawniejszą obsługę klientów oraz możliwość użycia tłumaczenia na urządzeniach z ograniczonym dostępem do sieci.

Google nie podał cen nowych rozwiązań, terminów ich szerszej dostępności ani wyników testów jakości dla poszczególnych języków. Materiał nie określa też, które funkcje i modele będą dostępne w Polsce.

Czy ten artykuł był pomocny?

Jeden głos na artykuł. Możesz go zmienić albo wycofać ponownym kliknięciem - Twój wybór zapamiętujemy w tej przeglądarce.

Redakcja

Zespół redakcyjny portalu. Piszemy i redagujemy teksty, weryfikujemy zgłoszenia od autorów i pilnujemy, żeby definicje w słowniku były aktualne.

Wszystkie artykuły autora →