Robocikowo>ROBOCIKOWO
Trening

Reward Function

1998AktywnyOpublikowano: 28 września 2026Aktualizacja: 28 września 2026Opublikowany
Funkcja nagrody odwzorowuje (stan, akcja, [stan następny]) na skalarną nagrodę, definiując cel agenta RL, który maksymalizuje oczekiwaną skumulowaną nagrodę (return).
Kluczowa innowacja
Formalizuje cel agenta jako pojedynczy skalarny sygnał nagrody, który zamienia otwarte "czego chcemy" w mierzalną, optymalizowalną funkcję celu — fundament całego uczenia ze wzmocnieniem.
Kategoria
Trening
Poziom abstrakcji
Primitive
Poziom operacji
TreningPo-treningSterowanie robotem
Zastosowania
Uczenie ze wzmocnieniemRobotyka: sterowanie, manipulacja, lokomocjaReward shaping i sim-to-realRLHF: dostrajanie modeli językowychGry i agenci decyzyjniReinforcement Learning with Verifiable Rewards (RLVR)Systemy rekomendacyjne i optymalizacja sekwencyjna

Jak działa

1) Środowisko modelowane jest jako MDP z przestrzenią stanów, akcji i dynamiką przejść. 2) W każdym kroku t agent wykonuje akcję a_t w stanie s_t, przechodzi do s_{t+1} i otrzymuje skalarną nagrodę r_{t+1} = R(s_t, a_t, s_{t+1}). 3) Zwrot definiuje się jako sumę dyskontowaną G_t = Σ_{k≥0} γ^k r_{t+k+1}, gdzie γ waży nagrody odległe w czasie. 4) Agent dąży do polityki π maksymalizującej oczekiwany zwrot E_π[G_t]. 5) Funkcje wartości V_π(s) i Q_π(s,a) szacują oczekiwany zwrot i sterują poprawą polityki (np. w PPO, GRPO). 6) Gdy nagroda jest rzadka, stosuje się reward shaping; kształtowanie oparte na potencjale F = γΦ(s') − Φ(s) nie zmienia polityki optymalnej. 7) W RLHF funkcję nagrody zastępuje model nagrody wytrenowany na parach preferencji ludzi, a polityka jest optymalizowana algorytmem RL (np. PPO) z karą KL względem modelu bazowego.

Rozwiązany problem

Uczenie ze wzmocnieniem potrzebuje jednoznacznej, mierzalnej definicji celu agenta. Funkcja nagrody rozwiązuje ten problem, sprowadzając dowolny cel do skalarnego sygnału, który można optymalizować metodami RL — bez konieczności podawania agentowi z góry poprawnych akcji (jak w uczeniu nadzorowanym).

Komponenty

Sygnał nagrody (scalar reward)Natychmiastowy sygnał zwrotny

Pojedyncza liczba rzeczywista zwracana przez środowisko po każdym przejściu; im wyższa, tym lepsze przejście z punktu widzenia celu.

Odwzorowanie nagrody RSpecyfikacja celu zadania

Funkcja przypisująca nagrodę parze (stan, akcja) lub trójce (stan, akcja, stan następny). Definiuje cel zadania.

Zwrot (return)Wielkość optymalizowana

Skumulowana, zwykle dyskontowana suma przyszłych nagród, którą agent maksymalizuje. Współczynnik dyskontowania γ waży nagrody odległe w czasie.

Człon kształtujący (shaping term)Przyspieszenie uczenia bez zmiany optimum

Dodatkowy sygnał dodawany do nagrody, aby przyspieszyć uczenie. Kształtowanie oparte na potencjale zachowuje politykę optymalną (Ng i in., 1999).

Oficjalna

Model nagrody (reward model)Zastępuje ręcznie zdefiniowaną nagrodę

Sieć neuronowa aproksymująca funkcję nagrody, trenowana na preferencjach ludzi, gdy jawne zdefiniowanie nagrody jest niemożliwe (np. jakość tekstu).

Oficjalna

Implementacja

Pułapki implementacyjne
Reward hacking / misspecificationKrytyczna

Agent maksymalizuje sygnał nagrody w sposób niezgodny z intencją projektanta, wykorzystując luki w definicji nagrody.

Rozwiązanie:Staranna specyfikacja, testy adwersaryjne, model nagrody z preferencji, kary za niepożądane zachowania, monitoring.
Rzadka nagroda i słaba eksploracjaWysoka

Gdy nagroda pojawia się dopiero przy celu, agent rzadko trafia na sygnał i uczenie jest bardzo powolne lub niemożliwe.

Rozwiązanie:Reward shaping, curriculum learning, motywacja wewnętrzna (intrinsic reward), hindsight experience replay.
Kształtowanie zmieniające politykę optymalnąWysoka

Dowolny dodatkowy sygnał nagrody może przesunąć optimum i nauczyć agenta niezamierzonego zachowania.

Rozwiązanie:Stosować kształtowanie oparte na potencjale (Ng i in., 1999), które gwarantuje niezmienność polityki optymalnej.
Niestabilna skala nagrodyŚrednia

Zbyt duże lub zmienne wartości nagrody destabilizują estymację gradientu i trening.

Rozwiązanie:Normalizacja i clipping nagród, standaryzacja zwrotu, dobór γ.
Nadmierna optymalizacja modelu nagrody (Goodhart)Wysoka

W RLHF polityka może przeoptymalizować niedoskonały model nagrody, degradując realną jakość (prawo Goodharta).

Rozwiązanie:Kara KL względem modelu bazowego, wczesne zatrzymanie, okresowe odświeżanie modelu nagrody.

Ewolucja

Oryginalny paper · 1998 · MIT Press · Richard S. Sutton
Reinforcement Learning: An Introduction
Richard S. Sutton, Andrew G. Barto
1957
Procesy decyzyjne Markowa i programowanie dynamiczne

Bellman formalizuje MDP i równanie optymalności, w którym nagroda jest częścią specyfikacji problemu.

1998
Hipoteza nagrody i kanoniczne ujęcie RL (Sutton & Barto)
Punkt przełomowy

Podręcznik "Reinforcement Learning: An Introduction" ustala funkcję nagrody jako centralny element RL i formułuje hipotezę nagrody.

1999
Kształtowanie nagrody oparte na potencjale
Punkt przełomowy

Ng, Harada i Russell dowodzą, że kształtowanie F = γΦ(s')−Φ(s) zachowuje politykę optymalną (niezmienność polityki).

2016
Reward hacking / misspecification w bezpieczeństwie AI

"Concrete Problems in AI Safety" (Amodei i in.) systematyzuje reward hacking jako jeden z kluczowych problemów źle zdefiniowanych nagród.

2017
Uczenie funkcji nagrody z preferencji ludzi
Punkt przełomowy

Christiano i in. pokazują, że można wytrenować model nagrody z preferencji ludzi zamiast ręcznie definiować nagrodę — podstawa RLHF.

2022
Model nagrody w RLHF na skalę (InstructGPT)
Punkt przełomowy

Ouyang i in. używają modelu nagrody z rankingów ludzi i PPO do alignmentu modeli językowych, upowszechniając RLHF.

Hiperparametry (konfigurowalne osie)

Współczynnik dyskontowania γKrytyczna

Waga nagród przyszłych względem bieżących (γ ∈ [0,1)). Niższe γ = krótki horyzont, wyższe γ = długi horyzont planowania.

Gęstość nagrody (sparse vs dense)Wysoka

Jak często pojawia się niezerowa nagroda. Rzadkie nagrody utrudniają eksplorację; gęste ułatwiają uczenie, ale grożą reward hackingiem.

Skala i normalizacja nagrodyŚrednia

Zakres wartości nagrody. Normalizacja/clipping stabilizują trening i zapobiegają dominacji pojedynczych składników.

Funkcja potencjału Φ (shaping)Średnia

Potencjał używany w kształtowaniu opartym na potencjale. Dobrze dobrany Φ przyspiesza uczenie bez zmiany polityki optymalnej.

Złożoność obliczeniowa

Złożoność czasowa: O(1) na przejście (analityczna); O(forward pass) dla modelu nagrody.

Wymagania sprzętowe

Podstawowe

Sama funkcja nagrody to specyfikacja/odwzorowanie i nie ma preferencji sprzętowej; koszt obliczeniowy zależy od jej realizacji.

Dobry fit

Gdy nagroda jest wyuczonym modelem (reward model w RLHF), jej ewaluacja to przejście sieci neuronowej korzystające z GPU.