1988AktywnyAktualizacja: 22 września 2026Opublikowany
W uczeniu ze wzmocnieniem: różnica między przewidywaną a bootstrapową (skorygowaną o kolejny krok) oszacowaną wartością stanu — sygnał ucząca funkcję wartości.
Kluczowa
innowacja
Uczenie się z bootstrapu — korygowanie przewidywań na podstawie kolejnego oszacowania, krok po kroku.
Kategoria
Trening
Poziom abstrakcji
Primitive
Poziom operacji
Trening
Zastosowania
Uczenie funkcji wartościQ-learning / SARSAAktor–krytyk
Jak działa
Oblicza się δ = r + γV(s′) − V(s) i aktualizuje V(s) w kierunku redukcji tego błędu.
Rozwiązany problem
Trzeba uczyć wartości stanów bez czekania na koniec epizodu i bez pełnego modelu środowiska.