Słownik AI
Multimodalność
multimodality
Zdolność modelu do przetwarzania więcej niż jednego rodzaju danych naraz - tekstu, obrazu, dźwięku, wideo.
Multimodalność oznacza, że model przyjmuje lub generuje dane różnego typu: tekst, obraz, dźwięk, wideo. Model multimodalny potrafi na przykład opisać zdjęcie, przeczytać wykres albo odpowiedzieć na pytanie o zawartość dokumentu w formie skanu.
Jak to działa
Wszystkie rodzaje danych są zamieniane na wspólną przestrzeń reprezentacji. Obraz jest dzielony na fragmenty i kodowany podobnie jak tekst na tokeny, dzięki czemu model może przetwarzać oba typy w jednym przebiegu.
Praktyczne zastosowania
- Odczyt danych z faktur i formularzy w formie zdjęć.
- Opis zawartości grafik dla osób niewidomych.
- Analiza wykresów i schematów w dokumentacji.
- Kontrola jakości na podstawie zdjęć z linii produkcyjnej.