Artificial Analysis uruchamia zestaw wybranych ewaluacji na każdym modelu w ustandaryzowany sposób, stosując punktację pass@1 (odsetek poprawnych prób). Wyniki poszczególnych testów są ważone wewnątrz czterech kategorii (Agents 34%, Coding 24%, Scientific Reasoning 24%, General 18%), a końcowy indeks to ważona średnia po kategoriach. Poszczególne testy mają własne wagi w indeksie (np. GDPval-AA v2 = 20%, Terminal-Bench v2.1 = 16%, τ³-Banking = 14%, HLE = 12%, AA-Omniscience = 12%, SciCode = 8%, AA-LCR = 6%, GPQA Diamond = 6%, CritPt = 6%). Ewaluacje są powtarzane wielokrotnie (>10 powtórzeń), co daje przedział ufności indeksu poniżej ±1%. Wersja v4.1.1 zaktualizowała komponent GDPval-AA z v1 (używanej w v4.0) do v2 z punktacją Elo zakotwiczoną w wynikach ludzkich ekspertów na poziomie 1000.
Pojedyncze benchmarki mierzą wąskie zdolności i szybko ulegają nasyceniu, a każdy dostawca raportuje inny podzbiór testów w niespójnych warunkach, co utrudnia bezpośrednie porównanie modeli. Intelligence Index dostarcza jedną, znormalizowaną, niezależnie liczoną wartość zbierającą wiele wymiarów zdolności w spójnych warunkach.
Agentowa ewaluacja realizacji ekonomicznie wartościowych zadań pracy (220 zadań, 44 zawody w USA); punktacja Elo zakotwiczona w wynikach ludzkich ekspertów na poziomie 1000.
Agent koordynujący wyszukiwanie wiedzy z nieustrukturyzowanych dokumentów fintech i wieloetapowe modyfikacje kont przez narzędzia (97 zadań).
Wykonywanie zadań w terminalu: inżynieria oprogramowania, administracja systemem, przetwarzanie danych, trening modeli, bezpieczeństwo (89 zadań).
Programowanie w Pythonie na wyzwaniach z obliczeń naukowych wymagających przejścia wszystkich testów jednostkowych (288 podproblemów).
Test wiedzy faktograficznej z karą za halucynacje w wielu domenach (6000 pytań).
Rozumowanie na wielu długich dokumentach (~100k tokenów na pytanie), 100 pytań.
Wiedza akademicka na poziomie frontier: matematyka, humanistyka, nauki przyrodnicze (2158 pytań).
Ekspercka wiedza naukowa: biologia, fizyka, chemia (198 trudnych pytań wielokrotnego wyboru).
Rozumowanie z fizyki na poziomie badawczym, na niepublikowanych problemach z różnych poddziedzin (70 wyzwań).
Podział wag końcowego indeksu na kategorie: Agents 34%, Coding 24%, Scientific Reasoning 24%, General 18%.
Udział każdego testu w indeksie (np. GDPval-AA v2 20%, Terminal-Bench v2.1 16%, τ³-Banking 14%).
Ewaluacje powtarzane >10 razy, aby przedział ufności indeksu był poniżej ±1%.
Wersja metodologii (bieżąca v4.1.1; v4.0 używała GDPval-AA v1; wcześniejsze wersje: MMLU-Pro, MATH-500, AIME 2025, LiveCodeBench, τ²-Bench Telecom).