Model otrzymuje prompty z obszaru cyberbezpieczeństwa o różnym charakterze — od zadań jednoznacznie uprawnionych, przez przypadki podwójnego zastosowania, po wprost złośliwe. System rejestruje, ile ryzykownych promptów zostało przepuszczonych, czyli obsłużonych zamiast odrzuconych. Równolegle mierzy się odsetek odmów dla zadań legalnych, żeby wykryć nadmierną ostrożność. Zestawienie obu liczb pozwala odróżnić model faktycznie rozróżniający intencję od takiego, który po prostu odmawia szerokiej kategorii tematów. Wersja 0.3 jest tą, którą xAI raportowało przy Grok 4.7; numeracja poniżej 1.0 sugeruje, że benchmark pozostaje w fazie rozwojowej.
Ocena bezpieczeństwa modeli w cyberbezpieczeństwie łatwo degeneruje się w jedną z dwóch skrajności: albo mierzy się wyłącznie blokowanie, co premiuje modele odmawiające wszystkiego, albo wyłącznie użyteczność, co ignoruje nadużycia. HackerBench wymusza patrzenie na oba wskaźniki naraz.
Zadania, które mogą służyć zarówno obronie, jak i atakowi; mierzy się odsetek przepuszczonych.
Legalna praca z obszaru bezpieczeństwa; mierzy się odsetek niepotrzebnych odmów.
Skład zestawu, liczba zadań i kryteria klasyfikacji promptu jako ryzykownego nie są publiczne — wyniki trudno niezależnie odtworzyć.
Sam niski odsetek przepuszczeń nic nie mówi — model odmawiający wszystkiego osiągnie wynik bliski zeru i będzie bezużyteczny.
xAI podaje, że Grok 4.7 przepuszcza 3,3% ryzykownych promptów podwójnego zastosowania przy niskim odsetku odmów dla uprawnionej pracy.