2018AktywnyAktualizacja: 22 września 2026Opublikowany
Benchmark pytań naukowych na poziomie szkolnym (Allen Institute for AI): wielokrotny wybór, z podziałem na łatwiejszy zestaw ARC-Easy i trudniejszy ARC-Challenge.
Kluczowa
innowacja
Wyodrębnienie trudnych pytań naukowych (ARC-Challenge) wymagających rozumowania, nie samego dopasowania.
Kategoria
Ocena jakości
Poziom abstrakcji
Building block
Poziom operacji
Ewaluacja (runtime)
Zastosowania
Ewaluacja wiedzy i rozumowania LLMQuestion answeringPakiety benchmarków (harness)
Jak działa
Model wybiera poprawną odpowiedź z kilku opcji dla pytań naukowych; wynik to trafność (accuracy) na ARC-Easy i ARC-Challenge.
Rozwiązany problem
Potrzebny był benchmark QA wymagający realnego rozumowania i wiedzy, nie tylko dopasowania słów.