Słownik AI

Chunking (dzielenie dokumentów)

chunking

Podział dokumentów na mniejsze fragmenty przed zapisaniem ich w bazie wektorowej. Od niego w dużej mierze zależy jakość odpowiedzi w RAG.

Chunking to podział dokumentów na fragmenty (ang. chunks), zanim zamieni się je na embeddingi i zapisze w bazie wektorowej. W systemie RAG model dostaje potem nie cały dokument, tylko kilka fragmentów najbliższych pytaniu.

Dlaczego to ważne

Za duży fragment zawiera kilka tematów naraz, więc jego embedding jest rozmyty i słabo pasuje do konkretnego pytania. Za mały traci kontekst: zdanie "termin wynosi 14 dni" nic nie znaczy, jeśli nie wiadomo, czego dotyczy. Sposób dzielenia wpływa na jakość odpowiedzi często bardziej niż wybór modelu.

Metody

  • Stała długość z zakładką: np. 500 tokenów, a kolejny fragment zaczyna się 50 tokenów przed końcem poprzedniego. Proste, ale tnie w połowie myśli.
  • Według struktury: podział po nagłówkach, akapitach, punktach regulaminu. Najlepszy wybór dla dokumentów z wyraźnym układem.
  • Semantyczny: granica tam, gdzie zmienia się temat, wykrywana z pomocą embeddingów.

Dobre praktyki

Do każdego fragmentu dołącz tytuł dokumentu i ścieżkę sekcji. Tabel nie dziel na części. Sprawdzaj jakość na prawdziwych pytaniach użytkowników, a nie na przykładach wymyślonych przy biurku.

Zobacz też: RAG w praktyce.