Agent trafia do interaktywnej gry bez instrukcji, regul i podanego celu. Postrzega kolejne klatki/stany srodowiska i wykonuje akcje w trybie turowym, samodzielnie odkrywajac mechanike oraz warunek zwyciestwa. Srodowiska sa nowe (novelty), co uniemozliwia zapamietanie rozwiazan. Ocena opiera sie na efektywnosci dzialan - liczbie akcji potrzebnych do ukonczenia poziomow w porownaniu z czlowiekiem; 100% oznacza pokonanie wszystkich gier tak sprawnie jak ludzie. Dostep odbywa sie przez API (wspolpraca z Hugging Face) oraz harness agentowy, a zbior dzieli sie na gry publiczne i prywatne (holdout), aby zapobiec przeuczeniu na jawnych zadaniach.
Statyczne benchmarki (ARC-AGI-1/2) oceniaja pojedyncze odpowiedzi i sa podatne na zapamietywanie oraz brute-force. Nie mierza zdolnosci agenta do dzialania w czasie: eksploracji, planowania dlugoterminowego przy rzadkim sygnale nagrody, aktualizacji przekonan i uczenia sie z doswiadczenia. ARC-AGI-3 wypelnia te luke, oceniajac inteligencje jako proces, a nie pojedynczy wynik.
Setki nowych, turowych gier bez instrukcji; agent postrzega stan i wykonuje akcje, odkrywajac cel i mechanike.
Interfejs (udostepniony we wspolpracy z Hugging Face) pozwalajacy agentom obserwowac stan i przesylac akcje w petli gry.
Oficjalna
Gry publiczne sluza do rozwoju agentow, a prywatne (holdout) do rzetelnej oceny na zadaniach nigdy niewidzianych.
Ocena liczby akcji potrzebnych do ukonczenia poziomow wzgledem czlowieka; 100% = tak sprawnie jak ludzie.
Francois Chollet publikuje ARC-AGI wraz z praca 'On the Measure of Intelligence' - statyczne zadania siatkowe.
Druga generacja statycznego benchmarku, trudniejsza dla modeli; powstaje fundacja ARC Prize.
Sneak peek z 3 grami publicznymi (ls20, ft09, vc33) i 3 prywatnymi (holdout) oraz pierwsza wersja API (Hugging Face).
Setki interaktywnych srodowisk i tysiace poziomow; przy starcie ludzie 100%, czolowe AI 0,51%; pula nagrod 2 mln USD, zawody na Kaggle.