Model dostaje zadanie odwzorowujące fragment wielotygodniowego projektu biznesowego i ma wytworzyć pliki wynikowe. Ocena łączy dwa mechanizmy. Rubryka sprawdza weryfikowalny sukces zadania — czy dostarczono to, o co proszono, w wymaganej postaci. Porównania parowe służą do oceny jakości analitycznej i jakości prezentacji: wyniki różnych modeli zestawia się parami, a wyłaniający się porządek przelicza na oceny Elo. Trzy składowe — jakość analityczna, jakość prezentacji i wynik rubryki — są następnie agregowane. Zestaw v1.1 liczy 91 zadań i wchodzi do Artificial Analysis Intelligence Index z wagą 15%.
Klasyczne benchmarki mierzą pojedyncze odpowiedzi, a praca umysłowa polega na wytworzeniu dokumentu, arkusza czy prezentacji, których jakości nie da się sprowadzić do jednego poprawnego ciągu znaków. AA Briefcase ocenia rzeczywiste artefakty i rozdziela to, co da się zweryfikować obiektywnie, od tego, co wymaga porównania jakościowego.
Zadania odwzorowują realistyczną pracę umysłową rozłożoną na wielotygodniowe projekty biznesowe.
Sprawdza weryfikowalny sukces zadania — czy dostarczono wymagane elementy w oczekiwanej postaci.
Jakość analityczna i prezentacyjna oceniane przez zestawianie wyników parami, przeliczane na oceny Elo.
Oceny Elo mają sens tylko względem konkretnego zbioru porównywanych modeli; dołożenie lub usunięcie uczestnika przesuwa skalę.
Część oceny dotyczy jakości prezentacji, co może premiować dopracowane wizualnie wyniki nad merytorycznie trafniejsze, lecz surowe.
AA Briefcase v1.1 obejmuje 91 zadań z plikami wyjściowymi i staje się najwyżej ważoną składową indeksu, na równi z AA-Omniscience.