Każde pytanie jest osadzone w zestawie dokumentów o łącznej długości około 100 tysięcy tokenów według tokenizatora cl100k_base. Odpowiedź nie znajduje się w jednym miejscu — model musi odnaleźć kilka istotnych fragmentów rozrzuconych po wejściu, powiązać je ze sobą i wyprowadzić wniosek. Odpowiedzi ocenia sprawdzarka równoważności oparta na modelu GPT, która porównuje wynik modelu z odpowiedzią wzorcową; punktacja to pass@1, czyli liczy się pierwsza próba. Zestaw obejmuje 100 pytań, a wynik wchodzi z wagą 5% do Artificial Analysis Intelligence Index.
Deklarowane okna kontekstu rosną szybciej niż realna zdolność modeli do korzystania z nich. Popularne testy typu „igła w stogu siana" sprawdzają jedynie odnalezienie pojedynczego faktu, co model może zrobić bez rozumienia całości. AA-LCR wymusza scalenie rozproszonych przesłanek, czyli to, co faktycznie odróżnia użyteczny długi kontekst od nominalnego.
Długość mierzona tokenizatorem cl100k_base; przesłanki potrzebne do odpowiedzi są celowo rozproszone po wielu fragmentach.
Pytania skonstruowane tak, by pojedynczy fragment nie wystarczał do udzielenia poprawnej odpowiedzi.
Porównuje odpowiedź modelu z wzorcem; punktacja pass@1 bez powtórzeń.
Oficjalna
Długość wejścia liczona jest cl100k_base; modele o innym tokenizatorze zobaczą inną liczbę własnych tokenów dla tego samego tekstu.
Ocena przez sprawdzarkę GPT wnosi własny szum i może inaczej traktować odpowiedzi poprawne merytorycznie, lecz inaczej sformułowane.
AA-LCR w wersji v1.1 obejmuje 100 pytań i wchodzi do Artificial Analysis Intelligence Index z wagą 5%.