Silnik startuje z rzeczywistych artefaktów, po czym agenci kodujący budują działające środowisko webowe, a agenci przeglądarkowi je testują; pętla generuj–testuj–audytuj–popraw wytwarza zadania z automatycznie weryfikowalnymi warunkami sukcesu. Dzięki temu powstają dziesiątki środowisk i tysiące zadań zamiast jednego stałego zestawu.
Statyczne, ręcznie tworzone benchmarki agentów webowych szybko się nasycają i nie skalują; WAI automatyzuje wytwarzanie wielu środowisk i zadań z weryfikowalnym sukcesem, ograniczając wyciek danych i pozwalając na ciągłą ocenę.
Statyczny, ręcznie zbudowany benchmark realistycznych środowisk webowych (Shuyan Zhou i in., NeurIPS 2024).
Automatyczne, skalowalne generowanie środowisk i weryfikowalnych zadań (marzec 2026).
DarwinX raportuje wzrost pass@1 do 93,0% (audit-clean) na oficjalnym zestawie 10 aplikacji / 1260 zadań.