Reward Function
Jak działa
1) Środowisko modelowane jest jako MDP z przestrzenią stanów, akcji i dynamiką przejść. 2) W każdym kroku t agent wykonuje akcję a_t w stanie s_t, przechodzi do s_{t+1} i otrzymuje skalarną nagrodę r_{t+1} = R(s_t, a_t, s_{t+1}). 3) Zwrot definiuje się jako sumę dyskontowaną G_t = Σ_{k≥0} γ^k r_{t+k+1}, gdzie γ waży nagrody odległe w czasie. 4) Agent dąży do polityki π maksymalizującej oczekiwany zwrot E_π[G_t]. 5) Funkcje wartości V_π(s) i Q_π(s,a) szacują oczekiwany zwrot i sterują poprawą polityki (np. w PPO, GRPO). 6) Gdy nagroda jest rzadka, stosuje się reward shaping; kształtowanie oparte na potencjale F = γΦ(s') − Φ(s) nie zmienia polityki optymalnej. 7) W RLHF funkcję nagrody zastępuje model nagrody wytrenowany na parach preferencji ludzi, a polityka jest optymalizowana algorytmem RL (np. PPO) z karą KL względem modelu bazowego.
Rozwiązany problem
Uczenie ze wzmocnieniem potrzebuje jednoznacznej, mierzalnej definicji celu agenta. Funkcja nagrody rozwiązuje ten problem, sprowadzając dowolny cel do skalarnego sygnału, który można optymalizować metodami RL — bez konieczności podawania agentowi z góry poprawnych akcji (jak w uczeniu nadzorowanym).
Komponenty
Pojedyncza liczba rzeczywista zwracana przez środowisko po każdym przejściu; im wyższa, tym lepsze przejście z punktu widzenia celu.
Funkcja przypisująca nagrodę parze (stan, akcja) lub trójce (stan, akcja, stan następny). Definiuje cel zadania.
Skumulowana, zwykle dyskontowana suma przyszłych nagród, którą agent maksymalizuje. Współczynnik dyskontowania γ waży nagrody odległe w czasie.
Dodatkowy sygnał dodawany do nagrody, aby przyspieszyć uczenie. Kształtowanie oparte na potencjale zachowuje politykę optymalną (Ng i in., 1999).
Oficjalna
Sieć neuronowa aproksymująca funkcję nagrody, trenowana na preferencjach ludzi, gdy jawne zdefiniowanie nagrody jest niemożliwe (np. jakość tekstu).
Oficjalna
Implementacja
Agent maksymalizuje sygnał nagrody w sposób niezgodny z intencją projektanta, wykorzystując luki w definicji nagrody.
Gdy nagroda pojawia się dopiero przy celu, agent rzadko trafia na sygnał i uczenie jest bardzo powolne lub niemożliwe.
Dowolny dodatkowy sygnał nagrody może przesunąć optimum i nauczyć agenta niezamierzonego zachowania.
Zbyt duże lub zmienne wartości nagrody destabilizują estymację gradientu i trening.
W RLHF polityka może przeoptymalizować niedoskonały model nagrody, degradując realną jakość (prawo Goodharta).
Ewolucja
Bellman formalizuje MDP i równanie optymalności, w którym nagroda jest częścią specyfikacji problemu.
Podręcznik "Reinforcement Learning: An Introduction" ustala funkcję nagrody jako centralny element RL i formułuje hipotezę nagrody.
Ng, Harada i Russell dowodzą, że kształtowanie F = γΦ(s')−Φ(s) zachowuje politykę optymalną (niezmienność polityki).
"Concrete Problems in AI Safety" (Amodei i in.) systematyzuje reward hacking jako jeden z kluczowych problemów źle zdefiniowanych nagród.
Christiano i in. pokazują, że można wytrenować model nagrody z preferencji ludzi zamiast ręcznie definiować nagrodę — podstawa RLHF.
Ouyang i in. używają modelu nagrody z rankingów ludzi i PPO do alignmentu modeli językowych, upowszechniając RLHF.
Hiperparametry (konfigurowalne osie)
Waga nagród przyszłych względem bieżących (γ ∈ [0,1)). Niższe γ = krótki horyzont, wyższe γ = długi horyzont planowania.
Jak często pojawia się niezerowa nagroda. Rzadkie nagrody utrudniają eksplorację; gęste ułatwiają uczenie, ale grożą reward hackingiem.
Zakres wartości nagrody. Normalizacja/clipping stabilizują trening i zapobiegają dominacji pojedynczych składników.
Potencjał używany w kształtowaniu opartym na potencjale. Dobrze dobrany Φ przyspiesza uczenie bez zmiany polityki optymalnej.
Złożoność obliczeniowa
Złożoność czasowa: O(1) na przejście (analityczna); O(forward pass) dla modelu nagrody.
Wymagania sprzętowe
Sama funkcja nagrody to specyfikacja/odwzorowanie i nie ma preferencji sprzętowej; koszt obliczeniowy zależy od jej realizacji.
Gdy nagroda jest wyuczonym modelem (reward model w RLHF), jej ewaluacja to przejście sieci neuronowej korzystające z GPU.