Słownik AI
Benchmark
benchmark
Standardowy zestaw zadań, na którym porównuje się modele AI. Wynik mówi, jak model radzi sobie z tym zestawem, a nie z Twoim procesem.
Benchmark to ustalony zestaw zadań z kluczem odpowiedzi, na którym mierzy się i porównuje modele AI. Wynik podaje się zwykle jako odsetek rozwiązanych zadań.
Przykłady
Są benchmarki z wiedzy i matematyki, z programowania i z pracy agentowej. W ogłoszeniach z 2026 roku pojawiają się m.in. Terminal-Bench (praca w terminalu), OSWorld (obsługa komputera), CursorBench (zadania programistyczne w edytorze) i ARC-AGI (rozumowanie na nowych łamigłówkach).
Pułapki
- Wyniki producenta. Większość liczb w komunikatach podaje sam dostawca, a niezależne powtórzenia pojawiają się później albo wcale.
- Różne ustawienia. Model testowany na najwyższym poziomie rozumowania wypada lepiej, ale kosztuje wielokrotnie więcej niż w codziennej konfiguracji.
- Skażenie danych. Zadania z publicznego zestawu mogły trafić do danych treningowych, więc model je pamięta, a nie rozwiązuje.
- Nasycenie. Gdy czołowe modele mają ponad 95%, test przestaje je od siebie odróżniać.
Własny test
Przy wyborze modelu do firmy przydaje się własny zestaw: 30-50 prawdziwych przypadków z procesu, z oczekiwanym wynikiem. Ten sam zestaw uruchamiasz na każdym kandydacie i po każdej zmianie promptu.
Zobacz też: jak wybrać model AI do projektu, wyniki GPT-6 Astra.