Model działa jako agent nad zadaniem projektowym z obszaru elektrotechniki. Materiał wejściowy bywa złożony — obejmuje abstrakcyjne schematy układów i diagramy systemowe, więc wymaga rzetelnego scalenia treści wizualnej z opisową. Wytworzony projekt przechodzi następnie trzy rodzaje kontroli: build checks sprawdzają, czy projekt w ogóle się buduje; pomiary symulacyjne weryfikują parametry elektryczne; ograniczenia BOM pilnują, czy użyte komponenty mieszczą się w zadanych wymaganiach. Każda z tych kontroli daje rozstrzygnięcie deterministyczne, więc ten sam wynik da się odtworzyć niezależnie. Równolegle mierzy się koszt i czas zadania oraz liczbę tokenów wyjściowych, co pozwala porównywać nie tylko skuteczność, ale i ekonomikę modelu.
Ocena modeli w dziedzinach inżynierskich zwykle opiera się na pytaniach zamkniętych albo na sędzim-modelu, co nie mówi nic o tym, czy zaprojektowany układ faktycznie działa. EEBench zamyka tę lukę: sprawdza artefakt inżynierski narzędziami, którymi i tak sprawdza się prawdziwy projekt.
Sprawdzają, czy wytworzony projekt daje się w ogóle zbudować — pierwsza, twarda bariera poprawności.
Symulacja mierzy, czy układ spełnia wymagane parametry, zamiast polegać na deklaracji modelu.
Lista materiałowa musi mieścić się w zadanych ograniczeniach — wyklucza projekty poprawne elektrycznie, lecz niewykonalne.
Leaderboard raportuje koszt na zadanie, czas na zadanie i liczbę tokenów wyjściowych obok samego wyniku.
Wynik mówi o elektrotechnice, nie o ogólnych zdolnościach inżynierskich; przenoszenie go na inne dziedziny jest nieuprawnione.
Deterministyczna weryfikacja wymaga konkretnego środowiska build i symulacji; zmiana wersji narzędzi może przesunąć wyniki.
atopile prowadzi publiczny leaderboard z możliwością zgłoszenia własnego modelu; w opublikowanym zestawieniu prowadzi GPT-6 Astra z wynikiem 69,3%.