Ewaluacja definiuje zagrożenia i progi ryzyka, następnie stosuje testy: automatyczne benchmarki, ustrukturyzowany red-teaming, oceny zdolności w kontrolowanych warunkach oraz eksperymenty behawioralne. Wyniki porównuje się z progami bezpieczeństwa (np. Responsible Scaling Policy), które determinują zabezpieczenia lub wstrzymanie wdrożenia.
Coraz zdolniejsze modele mogą stwarzać poważne ryzyka; bez rygorystycznej, standaryzowanej oceny nie da się wiarygodnie stwierdzić, czy model jest bezpieczny do wdrożenia.