Agenta uruchamia się na trzech benchmarkach składowych. DeepSWE v1.1 odpowiada za zdolność implementacyjną, Terminal-Bench 4.0 za pracę w środowisku terminalowym, a SWE-Atlas-QnA za rozumienie repozytorium kodu. Wyniki cząstkowe są uśredniane bez ważenia — wszystkie trzy składniki wchodzą do indeksu z równym udziałem. Prostota agregacji jest świadoma: pozwala odtworzyć wartość indeksu z publikowanych wyników cząstkowych i sprawdzić, który składnik odpowiada za zmianę pozycji modelu w rankingu.
Agenty kodujące ocenia się wieloma benchmarkami, z których każdy mierzy inny wycinek pracy; wyniki bywają sprzeczne i trudne do porównania między modelami. Indeks rozwiązuje ten problem porządkowo — daje jedną, jawnie zdefiniowaną liczbę, której skład można sprawdzić.
Mierzy zdolność agenta do realizacji zadań programistycznych typu software engineering.
66 zadań w środowisku terminalowym obejmujących inżynierię oprogramowania, administrację systemem i przetwarzanie danych; ocena pass/fail przez zestaw testów, pass@1 uśrednione z 3 powtórzeń.
Sprawdza, na ile agent rozumie strukturę i zawartość repozytorium kodu, a nie tylko potrafi pisać poprawne fragmenty.
Dwa modele o tym samym indeksie mogą mieć zupełnie różne profile — jeden mocny w terminalu i słaby w rozumieniu repozytorium, drugi odwrotnie.
Indeks jest wersjonowany (v1.5), a podmiana benchmarku składowego przesuwa wartości — wyniki z różnych wersji nie są wprost porównywalne.
Artificial Analysis opisuje Coding Agent Index jako średnią z DeepSWE v1.1, Terminal-Bench 4.0 i SWE-Atlas-QnA.