Każdy przykład to para (treść zadania, odpowiedź liczbowa). Model otrzymuje treść zadania i ma wygenerować odpowiedź końcową; ewaluacja polega na porównaniu wyekstrahowanej liczby z odpowiedzią wzorcową (exact match). W protokołach z LLM stosuje się warianty promptowania: zero-shot (bezpośrednia odpowiedź) oraz chain-of-thought (model najpierw wypisuje kroki rozumowania, potem podaje wynik). Kluczowym elementem jest ekstrakcja odpowiedzi z wygenerowanego tekstu (np. „the answer is …"). Powszechnie używany split to 420 przykładów treningowych i 180 testowych.
Umożliwia pomiar zdolności modelu do wieloetapowego rozumowania arytmetycznego — nie pojedynczego działania, lecz łańcucha operacji wyprowadzonych z opisu w języku naturalnym. Ujawnia różnicę między samym dopasowaniem wzorców a faktycznym prowadzeniem rachunku krok po kroku.
Krótki tekst (ok. 108–217 znaków) opisujący scenariusz z życia codziennego wymagający kilku działań arytmetycznych.
Łańcuch znaków reprezentujący liczbową odpowiedź końcową (zwykle 1–2 cyfry), używany do porównania exact match.
Współczesne LLM osiągają na MultiArith dokładność bliską 100%, przez co benchmark słabo różnicuje silne modele.
Wynik silnie zależy od reguły wydobycia liczby z tekstu; różne heurystyki dają różne dokładności dla tego samego modelu.
Zaledwie 600 przykładów oznacza dużą wariancję wyników i podatność na wyciek danych do zbiorów treningowych LLM.
Roy i Roth publikują „Solving General Arithmetic Word Problems" (EMNLP 2015); podzbiór 600 zadań wieloetapowych staje się później znany jako MultiArith.
Kojima i in. (NeurIPS 2022) pokazują, że „Let's think step by step" podnosi dokładność z 17,7% do 78,7% na text-davinci-002, czyniąc MultiArith kluczowym benchmarkiem rozumowania LLM.
Sposób odpytania modelu: zero-shot (bezpośrednia odpowiedź) vs chain-of-thought / zero-shot-CoT (jawne kroki rozumowania).
Reguła wydobycia liczby z wygenerowanego tekstu przed porównaniem exact match; ma istotny wpływ na wynik.