Agent otrzymuje treść zgłoszenia i migawkę repozytorium, po czym proponuje zmianę w kodzie (patch). Zmiana jest aplikowana i uruchamiane są testy repozytorium (w tym testy odtwarzające błąd i testy regresji). Zadanie liczy się jako rozwiązane, gdy wszystkie wymagane testy przechodzą; główną metryką jest odsetek rozwiązanych zgłoszeń (pass@1) na 500 zadaniach.
Pełny SWE-bench zawiera zadania nierozwiązywalne lub źle wyspecyfikowane, co zaniża i zaszumia wyniki; Verified dostarcza rzetelny, potwierdzony przez ludzi podzbiór do porównywania agentów kodujących.
Oryginalny benchmark rozwiązywania zgłoszeń GitHub (arXiv 2310.06770, ICLR 2024).
Zweryfikowany przez ludzi podzbiór 500 zadań; współpraca z OpenAI Preparedness (13 sierpnia 2024).