Słownik AI

Benchmark

benchmark

Standardowy zestaw zadań, na którym porównuje się modele AI. Wynik mówi, jak model radzi sobie z tym zestawem, a nie z Twoim procesem.

Benchmark to ustalony zestaw zadań z kluczem odpowiedzi, na którym mierzy się i porównuje modele AI. Wynik podaje się zwykle jako odsetek rozwiązanych zadań.

Przykłady

Są benchmarki z wiedzy i matematyki, z programowania i z pracy agentowej. W ogłoszeniach z 2026 roku pojawiają się m.in. Terminal-Bench (praca w terminalu), OSWorld (obsługa komputera), CursorBench (zadania programistyczne w edytorze) i ARC-AGI (rozumowanie na nowych łamigłówkach).

Pułapki

  • Wyniki producenta. Większość liczb w komunikatach podaje sam dostawca, a niezależne powtórzenia pojawiają się później albo wcale.
  • Różne ustawienia. Model testowany na najwyższym poziomie rozumowania wypada lepiej, ale kosztuje wielokrotnie więcej niż w codziennej konfiguracji.
  • Skażenie danych. Zadania z publicznego zestawu mogły trafić do danych treningowych, więc model je pamięta, a nie rozwiązuje.
  • Nasycenie. Gdy czołowe modele mają ponad 95%, test przestaje je od siebie odróżniać.

Własny test

Przy wyborze modelu do firmy przydaje się własny zestaw: 30-50 prawdziwych przypadków z procesu, z oczekiwanym wynikiem. Ten sam zestaw uruchamiasz na każdym kandydacie i po każdej zmianie promptu.

Zobacz też: jak wybrać model AI do projektu, wyniki GPT-6 Astra.