Słownik AI
RLHF
Reinforcement Learning from Human Feedback reinforcement learning from human feedback
Etap treningu, w którym model uczy się preferowanych odpowiedzi na podstawie ocen wystawianych przez ludzi.
RLHF to technika dostrajania modelu z użyciem ocen ludzkich. Po wstępnym treningu na tekstach model uczy się, które odpowiedzi ludzie uznają za lepsze - bardziej pomocne, bezpieczniejsze, trafniejsze.
Jak przebiega
- Model generuje kilka odpowiedzi na to samo zapytanie.
- Osoby oceniające szeregują je od najlepszej do najgorszej.
- Na tych ocenach trenowany jest model nagrody.
- Model główny jest dostrajany tak, żeby maksymalizować nagrodę.
Dlaczego to ważne
Model wytrenowany wyłącznie na przewidywaniu tekstu potrafi generować treści szkodliwe lub bezużyteczne - bo takie też występują w danych. RLHF sprawia, że modele odpowiadają w sposób oczekiwany przez użytkownika.
Skutki uboczne
Model uczy się też brzmieć przekonująco, bo takie odpowiedzi bywają wyżej oceniane. Częściowo stąd bierze się jego pewność siebie także wtedy, gdy się myli.