V(s)/Q(s,a) szacują oczekiwany zdyskontowany zwrot; uczy się je metodami TD lub Monte Carlo i wykorzystuje do wyboru akcji.
Agent potrzebuje oceny długoterminowej wartości stanów/akcji, a nie tylko natychmiastowej nagrody.