Agent otrzymuje polecenie i dostęp do zestawu narzędzi REST API reprezentujących symulowane aplikacje SaaS. Musi samodzielnie odkryć właściwe endpointy, wykonać sekwencję wywołań API realizujących zadanie i przestrzegać reguł biznesowych, ignorując rekordy-pułapki. Po zakończeniu grader porównuje stan końcowy środowiska z oczekiwanym: metryka partial_credit (0.0–1.0) mierzy odsetek spełnionych asercji, a task_completed_correctly to ścisłe zaliczenie/niezaliczenie całego zadania. Ocena jest deterministyczna, bez udziału sędziego LLM.
Istniejące benchmarki automatyzacji rzadko łączyły jednocześnie koordynację wielu aplikacji, samodzielne odkrywanie właściwych endpointów API oraz przestrzeganie reguł i polityk biznesowych — a także rzadko testowały agentów w środowiskach zaśmieconych nieistotnymi lub mylącymi danymi. AutomationBench mierzy zdolność agenta do wykonania realnego, wieloetapowego procesu biznesowego od początku do końca i pozostawienia systemów w poprawnym stanie.
Odizolowane, symulowane aplikacje SaaS (CRM, skrzynka pocztowa, kalendarz, arkusze itp.) z danymi początkowymi, w tym rekordami-pułapkami; agent działa wyłącznie przez wywołania REST API. Publiczny zestaw obejmuje 47 narzędzi.
600 punktowanych zadań w 6 domenach (sprzedaż, marketing, operacje, wsparcie, finanse, HR; po 100) plus niepunktowany zestaw „simple” z 200 prostymi zadaniami (1–2 kroki). Oficjalny ranking używa oddzielnego, trudniejszego, nieudostępnionego zestawu prywatnego.
Deterministyczny grader oparty na asercjach: partial_credit (0.0–1.0) i task_completed_correctly (pass/fail). Porównuje stan końcowy z oczekiwanym, bez sędziego LLM.
AutomationBench (Zapier) i AutomationBench-AA (niezależny ranking Artificial Analysis na prywatnym podzbiorze) używają różnych metryk. Ranking Zapiera raportuje odsetek zadań ukończonych w pełni; AutomationBench-AA raportuje średni udział zrealizowanych celów bez naruszeń guardrails — dlatego jego wyniki bywają znacznie wyższe.
Publiczny zestaw (600 zadań) jest łatwiejszy niż prywatny zestaw z oficjalnego rankingu; wyniki nie są bezpośrednio porównywalne.
Zapier publikuje pracę na arXiv (21 kwietnia 2026) oraz publiczny zestaw 600 zadań na GitHub; najlepsze modele frontier uzyskują poniżej 10% na trudnym zestawie.
Artificial Analysis, we współpracy z Zapierem, uruchamia niezależny ranking na prywatnym podzbiorze zadań, z metryką opartą na średnim udziale zrealizowanych celów bez naruszeń guardrails (odrębna encja od samego AutomationBench).
Publiczny (600 zadań, GitHub) vs prywatny/held-out (oficjalny ranking Zapiera).
Ranking raportuje wyniki przy różnych poziomach reasoning effort ocenianego modelu (np. max / xhigh).
Sześć domen: sprzedaż, marketing, operacje, wsparcie, finanse, HR (po 100 zadań w zestawie publicznym).