Ocena jakości
2023AktywnyAktualizacja: 22 września 2026Opublikowany Benchmark rozumowania matematycznego: 500 zadań (podzbiór zbioru MATH) używany do szybkiej, standardowej oceny zdolności matematycznych modeli.
Kluczowa
innowacja
Standardowy, zwarty (500-zadaniowy) benchmark matematyczny do szybkiej ewaluacji.
Poziom operacji
Ewaluacja (runtime)
Zastosowania
Ewaluacja rozumowania matematycznegoPorównywanie modeli rozumującychOcena metod post-treningu