Cały budżet RL jest wykorzystywany w jednym, starannie zaprojektowanym przebiegu treningu polityki, zamiast rozkładania go na wiele iteracji.
Wielokrotne rundy RL dla LLM są kosztowne obliczeniowo i niestabilne (dryf polityki, kolaps entropii).