Zadania powstają w oparciu o bazę czynności zawodowych O*NET: dla każdego z 44 zawodów praktycy z branży układają zestaw poleceń pokrywających większość typowych czynności. Model ma wytworzyć gotowy produkt pracy — nie odpowiedź w oknie czatu, lecz plik: dokument, arkusz, diagram. Ocena opiera się na porównaniach parowych przeprowadzanych przez ekspertów, którzy zestawiają dostarczone artefakty pod kątem relatywnej jakości. W wariancie GDPval-AA v2.1, uruchamianym przez Artificial Analysis w ramach Intelligence Index, modele pracują w środowisku agentowym z narzędziami, wytwarzają pliki wyjściowe, a 220 zadań agentowych ocenianych jest ślepymi porównaniami parowymi z przeliczeniem na Elo modelem Crowd-BT; ta składowa ma w indeksie wagę 10%.
Benchmarki akademickie mierzą rozumowanie w oderwaniu od tego, za co ktokolwiek płaci. GDPval wiąże ocenę z konkretnymi zawodami i ich rzeczywistymi czynnościami, dzięki czemu wynik da się interpretować w kategoriach ekonomicznych, a nie tylko jako punkt na abstrakcyjnej skali zdolności.
Co najmniej 30 zadań na zawód w pełnym zestawie i 5 w podzbiorze gold; dziewięć sektorów gospodarki USA.
Zadania mają pokrywać większość czynności zawodowych rejestrowanych dla profesji; zawód uznawano za pracę umysłową przy co najmniej 60% czynności niefizycznych.
Zadania układają praktycy branżowi, co ma zapewnić realizm poleceń i oczekiwanych produktów pracy.
Eksperci zestawiają artefakty pod kątem relatywnej jakości; w wariancie GDPval-AA v2.1 ślepe porównania przeliczane są na Elo modelem Crowd-BT.
Dobór zawodów i sektorów opiera się na strukturze gospodarki Stanów Zjednoczonych i bazie O*NET; przenoszenie wniosków na inne rynki wymaga ostrożności.
GDPval OpenAI i GDPval-AA v2.1 Artificial Analysis mają różną liczbę zadań i inny harness — wyniki nie są wprost porównywalne.
We wrześniu 2025 OpenAI publikuje zestaw 1320 zadań z 44 zawodów i dziewięciu sektorów, oceniany na gotowych produktach pracy.
Artificial Analysis uruchamia własny wariant: 220 zadań agentowych z plikami wyjściowymi, ślepe porównania parowe i Elo modelem Crowd-BT, z wagą 10% w indeksie.