Model otrzymuje treść zadania AIME i musi wygenerować rozwiązanie zakończone pojedynczą odpowiedzią całkowitą (000–999). Odpowiedź jest wyodrębniana z wygenerowanego tekstu i porównywana z kluczem. Standardową metryką jest pass@1 (odsetek zadań rozwiązanych poprawnie przy jednej próbie); ze względu na małą liczbę zadań (15 na edycję, 30 łącznie dla AIME I+II) często raportuje się uśrednienie z wielu próbkowań (avg@n / mean pass@1) w celu redukcji wariancji.
Benchmarki matematyczne szybko ulegają zanieczyszczeniu danymi treningowymi (data contamination), przez co przestają rzetelnie mierzyć rzeczywiste rozumowanie modelu. Świeża edycja AIME 2026 dostarcza aktualny, prawdopodobnie nieobecny w treningu zestaw zadań, pozwalając ocenić generalizację rozumowania matematycznego zamiast zapamiętywania.
MAA co roku wydaje dwie wersje egzaminu; obie bywają używane jako oddzielne lub połączone zestawy testowe dla modeli AI.
Każda edycja zawiera 15 zadań; odpowiedzią jest liczba całkowita 000–999, co ułatwia automatyczną, jednoznaczną weryfikację odpowiedzi modelu.
Odsetek poprawnych odpowiedzi przy jednej próbie; często uśredniany po wielu próbkowaniach ze względu na małą próbę.
Starsze edycje AIME mogą przeniknąć do danych treningowych, zawyżając wyniki; dlatego preferuje się najświeższą edycję.
Tylko 15 zadań na edycję (30 dla AIME I+II) sprawia, że pojedynczy pass@1 jest zaszumiony.
Wyodrębnienie końcowej liczby całkowitej z rozumowania modelu bywa zawodne i wpływa na wynik.
MAA wprowadza AIME jako 15-zadaniowy, 3-godzinny egzamin selekcyjny.
Edycja 2024 zaczyna być masowo raportowana w kartach modeli rozumujących jako miara rozumowania matematycznego (pass@1).
Po opublikowaniu zadań w 2025 r. edycja staje się aktualnym benchmarkiem; zestaw AIME 2025 zostaje włączony m.in. do metodologii Artificial Analysis.
Edycja 2026 pełni rolę najświeższego, prawdopodobnie nieobecnego w treningu zestawu do oceny modeli rozumujących.
Liczba prób dozwolonych przy ocenie; pass@1 to standard dla AIME.
Liczba generacji uśrednianych dla redukcji wariancji przy tylko 15 zadaniach na edycję.
Wpływa na różnorodność generacji i stabilność wyniku pass@1.