Słownik AI

RLHF

Reinforcement Learning from Human Feedback reinforcement learning from human feedback

Etap treningu, w którym model uczy się preferowanych odpowiedzi na podstawie ocen wystawianych przez ludzi.

RLHF to technika dostrajania modelu z użyciem ocen ludzkich. Po wstępnym treningu na tekstach model uczy się, które odpowiedzi ludzie uznają za lepsze - bardziej pomocne, bezpieczniejsze, trafniejsze.

Jak przebiega

  1. Model generuje kilka odpowiedzi na to samo zapytanie.
  2. Osoby oceniające szeregują je od najlepszej do najgorszej.
  3. Na tych ocenach trenowany jest model nagrody.
  4. Model główny jest dostrajany tak, żeby maksymalizować nagrodę.

Dlaczego to ważne

Model wytrenowany wyłącznie na przewidywaniu tekstu potrafi generować treści szkodliwe lub bezużyteczne - bo takie też występują w danych. RLHF sprawia, że modele odpowiadają w sposób oczekiwany przez użytkownika.

Skutki uboczne

Model uczy się też brzmieć przekonująco, bo takie odpowiedzi bywają wyżej oceniane. Częściowo stąd bierze się jego pewność siebie także wtedy, gdy się myli.