Model odpowiada na pytania zamknięte z zakresu biologii, przygotowane tak, by część dotyczyła rutynowej pracy badawczej, a część zapytań potencjalnie niebezpiecznych. Format zamknięty umożliwia ocenę w pełni automatyczną, bez sędziego opartego na modelu. Wyniki agreguje się jako endpoint pass rates — średnie odsetki zaliczeń liczone na poziomie pojedynczej ewaluacji i uśredniane po wielu konfiguracjach uruchomieniowych, co ogranicza wpływ przypadkowej zmienności. Osobno raportuje się wymiar kompetencji i wymiar odmów, dzięki czemu widać, czy niski wynik w kategorii ryzyka bierze się z rozumienia kontekstu, czy z ogólnej niewiedzy modelu.
Ocena modeli pod kątem ryzyka biologicznego bywa sprowadzana do samego odsetka odmów, co premiuje modele niekompetentne — model, który nie rozumie biologii, nie pomoże też w nadużyciu, ale jest bezużyteczny w badaniach. Benchmark rozdziela kompetencję od bezpieczeństwa i pozwala zobaczyć oba naraz.
Sprawdza pracę na rutynowych zadaniach badawczych, m.in. wykrywanie i poprawianie błędów w protokołach biologii molekularnej.
Mierzy, czy model odmawia wobec niebezpiecznych zapytań podwójnego zastosowania.
Format zamknięty pozwala uniknąć sędziego opartego na modelu; wyniki raportowane jako endpoint pass rates.
Pytania zamknięte dają obiektywną ocenę, ale nie sprawdzają, jak model zachowa się przy długiej, wieloetapowej rozmowie o protokole.
Wynik 62,4% bywa w źródłach przypisywany raz modelowi Grok 4.6, raz Grok 4.7 — przy cytowaniu trzeba wskazać konkretne źródło.
Benchmark obejmuje modele xAI, Anthropic, OpenAI i Google; raportowane endpoint pass rates rozciągają się od 14% do 50%, przy czołowym wyniku 62,4%.