2024BadawczyAktualizacja: 22 września 2026Opublikowany
Process Reward Model uzyskiwany bez etykiet krokowych — sygnał nagrody dla kroków wyprowadza się niejawnie z modelu trenowanego wyłącznie na nagrodach za końcowy wynik.
Kluczowa
innowacja
Uzyskanie nagród krokowych bez etykiet procesu — niejawnie z modelu uczonego na wyniku.
Kategoria
Zachowanie AI
Poziom abstrakcji
Building block
Poziom operacji
Po-trening
Zastosowania
Tani PRMRozumowanie matematyczneRL/reranking
Jak działa
Model nagrody trenuje się na sygnale końcowym; dzięki parametryzacji log-prawdopodobieństw nagrody krokowe wyłaniają się niejawnie.
Rozwiązany problem
Trening jawnych PRM wymaga drogich etykiet dla każdego kroku rozumowania.