Benchmark definiuje zbiór zadań o znanych odpowiedziach oraz metrykę (np. dokładność, pass@k, Elo). Model uruchamia się na tym samym zbiorze, a wyniki umieszcza na tablicy wyników (leaderboard). Dobre benchmarki zawierają ukryty zestaw testowy, aby ograniczyć wyciek danych i przetrenowanie.
Bez wspólnych, ustandaryzowanych testów nie da się obiektywnie porównać, który model jest lepszy w danym zadaniu ani śledzić postępu dziedziny.