Model podaje numer wyroku sądu, którego nie ma. Cytuje badanie z nazwiskami i rokiem - badanie nie istnieje. Odpowiedź brzmi kompetentnie, a jest fikcją. To zjawisko nazwano halucynacją i jest dziś główną przeszkodą w zastosowaniach, gdzie cena błędu jest wysoka.
Skąd się to bierze
Model językowy generuje tekst, wybierając kolejne tokeny o wysokim prawdopodobieństwie w danym kontekście. Nie ma osobnego mechanizmu odpowiadającego za prawdziwość. Prawdziwe zdania pojawiają się dlatego, że w danych treningowych występowały częściej niż fałszywe - nie dlatego, że model je weryfikuje.
Kiedy pytasz o coś, czego w wagach nie ma, model nie napotyka żadnej blokady. Generuje najbardziej prawdopodobny ciąg pasujący do wzorca odpowiedzi. Tak powstaje przypis, który wygląda idealnie i prowadzi donikąd.
Trzy typy halucynacji
1. Zmyślony fakt
Nieistniejące źródła, wymyślone dane liczbowe, funkcje biblioteki, których nie ma w dokumentacji. Najgroźniejszy typ, bo najtrudniejszy do wychwycenia bez sprawdzenia.
2. Sprzeczność z dostarczonym materiałem
Model dostał dokument, ale odpowiedział wbrew jego treści - zwykle dlatego, że jego wcześniejsza "wiedza" z treningu przeważyła nad materiałem w kontekście.
3. Błąd rozumowania
Wszystkie fakty są poprawne, ale wniosek z nich nie wynika. Częste przy zadaniach wymagających wielu kroków i porównań liczbowych.
Co realnie pomaga
Dostarczenie źródeł w zapytaniu
Najskuteczniejsza pojedyncza metoda. Gdy model streszcza tekst, który ma przed sobą, zamiast odtwarzać wiedzę z wag, liczba zmyśleń spada radykalnie. To fundament RAG.
Wymóg cytowania
Instrukcja "przy każdym twierdzeniu podaj fragment źródła, z którego ono wynika" działa dwojako: ułatwia weryfikację i sama w sobie ogranicza zmyślanie, bo model musi powiązać zdanie z konkretnym materiałem.
Wyraźne pozwolenie na niewiedzę
Model jest trenowany tak, żeby był pomocny - co przy braku wiedzy popycha go do wymyślania. Zdanie "jeśli nie ma tego w materiałach, napisz: nie znalazłem" zmienia domyślne zachowanie.
Weryfikacja zewnętrzna
Wszystko, co da się sprawdzić kodem, sprawdzaj kodem: czy podany numer istnieje w bazie, czy suma się zgadza, czy odnośnik zwraca odpowiedź. To najpewniejsza warstwa ochrony.
Obniżenie temperatury
Przy zadaniach faktograficznych niska temperatura ogranicza sięganie po mniej prawdopodobne kontynuacje. Nie rozwiązuje problemu, ale zmniejsza jego skalę.
Rozbicie zadania
Jedno pytanie na raz, z materiałem dopasowanym do tego pytania. Przy zapytaniach złożonych model częściej gubi wątek i wypełnia luki domysłem.
Sprawdzenie drugim przebiegiem
Osobne wywołanie z pytaniem "czy poniższa odpowiedź wynika z tego materiału?" wychwytuje część błędów. Metoda kosztowna i niedoskonała - sprawdzający też może się mylić - ale przy wysokiej stawce bywa opłacalna.
Co daje tylko złudzenie kontroli
Pierwszy odruch to zapytać model, na ile jest pewny. Nic to nie daje: deklarowana pewność słabo koreluje z poprawnością, a fakty i zmyślenia model potwierdza równie stanowczo. Podobnie z instrukcją "nie halucynuj" - nie ma stanu wewnętrznego, który dałoby się w ten sposób wyłączyć.
Najtrwalsze jest jednak trzecie złudzenie: że problem rozwiąże nowszy model. Kolejne wersje faktycznie zmyślają rzadziej. Tyle że rzadszy błąd bywa groźniejszy od częstego, bo usypia czujność - po dwustu poprawnych odpowiedziach nikt już nie sprawdza dwieście pierwszej.
Projektowanie systemu odpornego na halucynacje
Ustal cenę błędu
Inne zabezpieczenia stosuje się przy podsumowaniu notatki, inne przy informacji medycznej.
Ogranicz zakres pytań
System odpowiadający na wąski zestaw tematów myli się rzadziej niż uniwersalny asystent.
Pokaż źródła użytkownikowi
Odnośnik do fragmentu przenosi część weryfikacji na czytelnika - to uczciwe i skuteczne.
Zbieraj zgłoszenia błędów
Przycisk "ta odpowiedź jest błędna" daje materiał do poprawy bazy i instrukcji.
Najczęstsze pytania
Przy obecnej architekturze - nie całkowicie. Model generuje prawdopodobny tekst, a nie sprawdza fakty. Ograniczyć je można architekturą systemu: dostarczaniem źródeł, weryfikacją zewnętrzną i zawężeniem zakresu.
Ogranicza je znacząco, ale nie usuwa. Model potrafi błędnie zinterpretować fragment albo połączyć materiał z wiedzą z treningu. Dlatego cytowanie źródeł i możliwość ich sprawdzenia pozostają istotne.
Sprawdzaj wszystko, co brzmi jak konkret: numery, daty, nazwiska, tytuły publikacji, nazwy funkcji. Im bardziej szczegółowa informacja, tym większa szansa, że została skonstruowana zamiast odtworzona.
