PRM przypisuje ocenę każdemu krokowi rozumowania; oceny te służą do treningu, rerankingu lub przeszukiwania w czasie inferencji.
Nagroda tylko za końcowy wynik jest rzadka i nie wskazuje, który krok rozumowania był błędny.