Każdy rekord zawiera treść zadania oraz wzorcowe rozwiązanie zapisane w języku naturalnym jako ciąg kroków. Obliczenia są otoczone adnotacjami kalkulatora <<obliczenie=wynik>> (np. <<50*3=150>>), a ostateczna odpowiedź liczbowa znajduje się po znaczniku #### w ostatniej linii. Ewaluacja polega na wygenerowaniu przez model rozwiązania (najczęściej z rozumowaniem łańcuchem myśli), wyekstrahowaniu liczby po #### i porównaniu jej z odpowiedzią wzorcową (dokładne dopasowanie). Wariant Socratic wstrzykuje automatycznie wygenerowane podpytania przed każdym krokiem. W oryginalnej metodzie autorzy generowali wiele kandydujących rozwiązań i wybierali to najwyżej ocenione przez wytrenowany weryfikator, co poprawiało dokładność względem zwykłego dostrajania.
Brakowało standaryzowanego, wystarczająco trudnego, ale rozwiązywalnego benchmarku do pomiaru wieloetapowego rozumowania arytmetycznego modeli językowych. Wcześniejsze zbiory były albo zbyt łatwe (nasycone), albo zbyt szablonowe, co pozwalało modelom trafiać w odpowiedź bez faktycznego rozumowania. GSM8K dostarcza zróżnicowanych językowo zadań wymagających łańcucha kilku kroków, z jawnym formatem odpowiedzi umożliwiającym automatyczną, jednoznaczną ewaluację.
Szkolne zadanie tekstowe z matematyki, zróżnicowane językowo, wymagające 2–8 kroków rozumowania.
Wzorcowe rozwiązanie w języku naturalnym rozpisane jako sekwencja elementarnych obliczeń.
Obliczenia otoczone znacznikami <<obliczenie=wynik>>, umożliwiające wstrzyknięcie zewnętrznego kalkulatora i weryfikację arytmetyki.
Oficjalna
Liczbowa odpowiedź po znaczniku #### w ostatniej linii, umożliwiająca jednoznaczną, automatyczną ewaluację (dokładne dopasowanie).
Modyfikacja formatu wstrzykująca automatycznie wygenerowane podpytania przed każdym krokiem rozwiązania.
Oficjalna
Model rankingujący wiele wygenerowanych kandydujących rozwiązań; wybór najwyżej ocenionego przewyższa zwykłe dostrajanie (metoda z oryginalnej pracy).
Oficjalna
GSM8K trafił do korpusów pretreningowych wielu modeli, co zawyża wyniki i utrudnia uczciwe porównania.
Niepoprawne parsowanie liczby po #### (formatowanie, przecinki, jednostki) prowadzi do zaniżonych lub zawyżonych wyników.
Adnotacje <<...>> trzeba usunąć przed ewaluacją tekstu lub konsekwentnie wykorzystać jako zewnętrzny kalkulator; niespójność zaburza porównania.
Zbiór obejmuje wyłącznie angielskie zadania na poziomie szkoły podstawowej z arytmetyką; wysoki wynik nie dowodzi ogólnych zdolności matematycznych.
OpenAI publikuje GSM8K wraz z metodą trenowania weryfikatorów rankingujących wiele rozwiązań.
Promptowanie łańcuchem myśli (Wei i in.) drastycznie poprawia wyniki na GSM8K, ustanawiając go podstawowym benchmarkiem rozumowania LLM.
Metoda self-consistency (Wang i in.) dodatkowo podnosi dokładność na GSM8K przez próbkowanie wielu ścieżek i głosowanie.
Modele frontier osiągają ponad 90% dokładności na GSM8K, sygnalizując nasycenie benchmarku i potrzebę trudniejszych testów.
GSM-Symbolic (Apple) generuje symboliczne warianty zadań GSM8K, ujawniając wrażliwość modeli na zmiany powierzchniowe i ryzyko kontaminacji danych.
Liczba elementarnych kroków potrzebnych do rozwiązania zadania.
Podział zbioru na część treningową i testową.
Sposób oceny poprawności odpowiedzi modelu.
Sposób odpytywania modelu, silnie wpływający na wynik.