SRE-Bench uruchamia agenta w środowisku Kubernetes, do którego injektory awarii wprowadzają zdefiniowany scenariusz incydentu (np. stały ConfigMap powodujący drift ArgoCD i CrashLoopBackOff, wygasła rotacja sekretu prowadząca do awarii uwierzytelniania bazy, czy presja na węzły z błędnie skonfigurowanym HPA). Każdy scenariusz opisuje pierwotny trigger, ścieżkę propagacji, wpływ, sygnały detekcji oraz kroki mitygacji. Agent obserwuje stan klastra (kubectl, zdarzenia, metryki Prometheus, logi) i ma za zadanie zdiagnozować przyczynę źródłową oraz przeprowadzić bezpieczną remediację. Harness ewaluacyjny mierzy wynik za pomocą metryk operacyjnych: czasu do diagnozy, wskaźnika bezpiecznej remediacji, MTTR oraz wyjaśnialności decyzji. Scenariusze są modularne i społecznościowe — użytkownicy mogą dodawać własne przypadki testowe.
Dotychczasowe benchmarki agentów AI (np. SWE-bench) mierzą naprawę kodu, ale nie oddają realiów pracy inżyniera niezawodności, gdzie liczy się diagnozowanie i naprawa żywych, kaskadowych incydentów w działającym systemie produkcyjnym. Brakowało otwartego, odtwarzalnego środowiska, w którym można ocenić, czy agent potrafi bezpiecznie rozpoznać przyczynę źródłową awarii w Kubernetes i przeprowadzić remediację bez pogorszenia sytuacji. SRE-Bench wypełnia tę lukę, dostarczając wystandaryzowane scenariusze awarii i harness ewaluacyjny.
Zestaw 17 scenariuszy rzeczywistych incydentów symulujących kaskadowe awarie w Kubernetes, GitOps i cloud-native — od ImagePullBackOff po wielowarstwowe łańcuchy awarii.
Mechanizmy wprowadzające zdefiniowaną awarię do klastra (np. drift konfiguracji, wygasłe sekrety, presja na węzły).
Deklaratywne manifesty definiujące stan bazowy aplikacji i infrastruktury dla scenariusza.
Oficjalna
Definicje sygnałów detekcji — metryk Prometheus, zdarzeń i alertów — na których agent opiera diagnozę.
Oficjalna
Warstwa scoringu mierząca wynik agenta metrykami: time-to-diagnose, safe remediation rate, MTTR i wyjaśnialność.
Referencyjne implementacje agentów służące jako punkt odniesienia przy porównywaniu własnych agentów.
Oficjalna
Agentkube udostępnia SRE-Bench na GitHub (licencja MIT) jako benchmark agentów SRE inspirowany SWE-bench, z biblioteką 17 scenariuszy incydentów Kubernetes.
SRE-Bench to benchmark/środowisko ewaluacyjne działające na klastrze Kubernetes — nie jest związany z konkretnym typem akceleratora; wymagania sprzętowe zależą od ocenianego agenta.