Model dostaje zadanie z jednej z domen biznesowych i zestaw narzędzi wystawionych jako REST API. Wykonuje ciąg wywołań, dążąc do zrealizowania przepływu pracy. Wynik jest binarny: zadanie zaliczone albo nie, bez ocen częściowych i bez sędziego opartego na modelu. Równolegle system sprawdza, czy w trakcie wykonania doszło do naruszenia barierek — czyli czy agent wykonał operację, której nie powinien. Łącznie zestaw obejmuje 657 zadań, a zagregowany wynik wchodzi z wagą 5% do Artificial Analysis Intelligence Index.
Deklaracje o „agentach automatyzujących procesy biznesowe" trudno zweryfikować, bo sukces zależy od konkretnego środowiska narzędziowego i od tego, czy agent nie łamie po drodze reguł organizacji. AutomationBench-AA daje powtarzalne środowisko z prawdziwymi wywołaniami REST API i jawnym rejestrem naruszeń barierek.
Zadania odwzorowujące przepływy pracy w oprogramowaniu SaaS, rozłożone na różne obszary działalności firmy.
Model działa przez rzeczywiste wywołania API, a nie przez symulowany opis narzędzi.
Niezależnie od zaliczenia zadania rejestruje się, czy agent wykonał operację niedozwoloną.
Agent, który wykonał 90% przepływu i potknął się na ostatnim wywołaniu, dostaje zero — wyniki bywają przez to skokowe.
AutomationBench-AA to instancja uruchomieniowa Artificial Analysis; wyniki nie muszą być wprost porównywalne z wynikami raportowanymi na samym AutomationBench.
AutomationBench-AA wchodzi do indeksu z wagą 5%, obejmując 657 zadań z narzędziami REST API.