Model uczenia (np. sieć neuronowa lub polityka RL) jest trenowany na danych z symulacji lub rzeczywistości, aby odwzorować obserwacje stanu na działania sterujące; strategia jest optymalizowana względem funkcji nagrody/celu i doskonalona iteracyjnie, często z transferem z symulacji do rzeczywistości (sim-to-real).
Dla wielu układów (np. dynamiczna lokomocja, kontakt, zręczna manipulacja) trudno wyprowadzić dokładny model analityczny; sterowanie oparte na uczeniu pozwala uzyskać skuteczne strategie sterowania bezpośrednio z danych.