Słownik AI

Multimodalność

multimodality

Zdolność modelu do przetwarzania więcej niż jednego rodzaju danych naraz - tekstu, obrazu, dźwięku, wideo.

Multimodalność oznacza, że model przyjmuje lub generuje dane różnego typu: tekst, obraz, dźwięk, wideo. Model multimodalny potrafi na przykład opisać zdjęcie, przeczytać wykres albo odpowiedzieć na pytanie o zawartość dokumentu w formie skanu.

Jak to działa

Wszystkie rodzaje danych są zamieniane na wspólną przestrzeń reprezentacji. Obraz jest dzielony na fragmenty i kodowany podobnie jak tekst na tokeny, dzięki czemu model może przetwarzać oba typy w jednym przebiegu.

Praktyczne zastosowania

  • Odczyt danych z faktur i formularzy w formie zdjęć.
  • Opis zawartości grafik dla osób niewidomych.
  • Analiza wykresów i schematów w dokumentacji.
  • Kontrola jakości na podstawie zdjęć z linii produkcyjnej.