Słownik AI
Chunking (dzielenie dokumentów)
chunking
Podział dokumentów na mniejsze fragmenty przed zapisaniem ich w bazie wektorowej. Od niego w dużej mierze zależy jakość odpowiedzi w RAG.
Chunking to podział dokumentów na fragmenty (ang. chunks), zanim zamieni się je na embeddingi i zapisze w bazie wektorowej. W systemie RAG model dostaje potem nie cały dokument, tylko kilka fragmentów najbliższych pytaniu.
Dlaczego to ważne
Za duży fragment zawiera kilka tematów naraz, więc jego embedding jest rozmyty i słabo pasuje do konkretnego pytania. Za mały traci kontekst: zdanie "termin wynosi 14 dni" nic nie znaczy, jeśli nie wiadomo, czego dotyczy. Sposób dzielenia wpływa na jakość odpowiedzi często bardziej niż wybór modelu.
Metody
- Stała długość z zakładką: np. 500 tokenów, a kolejny fragment zaczyna się 50 tokenów przed końcem poprzedniego. Proste, ale tnie w połowie myśli.
- Według struktury: podział po nagłówkach, akapitach, punktach regulaminu. Najlepszy wybór dla dokumentów z wyraźnym układem.
- Semantyczny: granica tam, gdzie zmienia się temat, wykrywana z pomocą embeddingów.
Dobre praktyki
Do każdego fragmentu dołącz tytuł dokumentu i ścieżkę sekcji. Tabel nie dziel na części. Sprawdzaj jakość na prawdziwych pytaniach użytkowników, a nie na przykładach wymyślonych przy biurku.
Zobacz też: RAG w praktyce.