1) Zebrano realne podatnosci z popularnych projektow open source (kod, opis, historia poprawek). 2) Agent AI (z narzedziami: dostep do repozytorium, uruchamianie kodu, fuzzing itp.) dostaje zadanie - np. odtworzyc podatnosc, wygenerowac PoC lub napisac latke. 3) Wynik jest automatycznie weryfikowany wzgledem rzeczywistego zachowania (np. czy exploit wyzwala podatnosc, czy latka ja usuwa bez regresji). 4) Metryki (skutecznosc odkrywania/PoC/latek) sluza do porownywania agentow i modeli oraz sledzenia postepu w czasie.
Dotychczasowe benchmarki cyberbezpieczenstwa byly male, syntetyczne lub latwe do 'wyuczenia'. CyberGym mierzy realne zdolnosci agentow AI na prawdziwych podatnosciach OSS, dajac wiarygodny obraz ich mozliwosci ofensywnych i defensywnych oraz ryzyka.
1507 realnych podatnosci ze 188 projektow OSS (E2E: 920/139) z kodem i historia poprawek.
Narzedzia dla agenta: repozytorium, uruchamianie kodu, fuzzing, analiza.
Oficjalna
Sprawdza wynik wzgledem rzeczywistosci (exploit wyzwala luke, latka ja usuwa).
Oficjalna
Skutecznosc odkrywania/PoC/latek do porownywania agentow i modeli.
Oficjalna
Ewaluacja generuje dzialajace exploity - wymaga scislej izolacji, by nie wyrzadzic szkod.
Agenci zdolni znajdowac zero-day moga byc wykorzystani ofensywnie.
Publiczne podatnosci OSS moga trafic do danych treningowych modeli, zawyzajac wyniki.
RDI (UC Berkeley) publikuje CyberGym - 1507 realnych podatnosci ze 188 projektow OSS (arXiv:2506.02548).
Prezentacja na ICLR 2026 oraz wariant E2E (920 podatnosci/139 projektow); wykrycie 35 zero-day i 17 niepelnych latek.
Złożoność czasowa: Nie dotyczy (benchmark ewaluacyjny, nie algorytm). Złożoność przestrzenna: Nie dotyczy.
Ewaluacja wymaga uruchamiania kodu/exploitow w izolowanych srodowiskach (sandbox) dla 1500+ zadan; waskim gardlem jest bezpieczne wykonanie i weryfikacja, a nie sam model.
Odkrywanie/reprodukcja podatnosci, generowanie PoC lub tworzenie latki.
Pelny (1507/188) vs CyberGym-E2E (920/139).
Dostepne agentowi narzedzia (repo, uruchamianie kodu, fuzzing).
Opis dotyczy przebiegu ewaluacji agenta; sam benchmark nie jest paradygmatem obliczeniowym modelu.
Zadania mozna uruchamiac rownolegle w wielu sandboxach.
To benchmark/protokol ewaluacji - niezalezny od typu akceleratora; wykonanie zadan dziala na CPU (sandbox), a oceniany agent moze korzystac z GPU.