Agent otrzymuje realistyczne zadanie (jedno z 300) i wykonuje je na zywej stronie (jednej ze 136 witryn), nawigujac i wchodzac w interakcje jak uzytkownik. Po zakonczeniu ludzie oceniaja, czy zadanie zostalo faktycznie wykonane (ocena ludzka zamiast automatycznej), co daje wiarygodny wskaznik skutecznosci. Poniewaz strony sa dynamiczne, test odzwierciedla realne warunki (zmiany UI, tresci, dostepnosci). Wyniki roznych agentow/modeli trafiaja na wspolny leaderboard.
Starsze benchmarki agentow webowych opieraly sie na buforowanych stronach i automatycznej ocenie, przez co zawyzaly skutecznosc agentow. Brakowalo miary realnego dzialania na zywych, zmieniajacych sie stronach z wiarygodna ocena.
300 realistycznych zadan na 136 zywych witrynach, odzwierciedlajacych realne uzycie.
Ludzie oceniaja, czy zadanie zostalo faktycznie wykonane - zamiast automatycznej, zawyzajacej oceny.
Testy w czasie rzeczywistym wobec dynamicznych, zmieniajacych sie interfejsow.
Oficjalna
Publiczny ranking wynikow agentow i modeli.
Oficjalna
Ocena przez ludzi jest wiarygodna, ale kosztowna i wolniejsza niz automatyczna.
Zmiany na zywych stronach moga wplywac na powtarzalnosc i porownywalnosc wynikow w czasie.
OSU-NLP wprowadzil Mind2Web - benchmark do generalistycznych agentow webowych, oparty na zebranych/buforowanych danych.
Live wersja z ludzka ewaluacja ujawnila, ze realna skutecznosc agentow jest znacznie nizsza niz na starszych benchmarkach.