Trening prowadzi się w ramach metauczenia na rodzinie zadań o wielu instancjach. Sieć dostaje pary demonstracji dla podzbioru zadań: na wejściu jedną demonstrację oraz bieżący stan, a jej wyjście ma odtworzyć działania odpowiadające trajektorii z drugiej demonstracji tego samego zadania. Architektura wykorzystuje miękką uwagę (soft attention), co pozwala uogólniać poza dane treningowe i skalować się na różnorodne zadania i warunki. W czasie testu system dostaje jedną demonstrację nowego zadania i działa na nieoglądanych wcześniej instancjach tego zadania. We współczesnych realizacjach z modelami bazowymi rolę „demonstracji na wejściu" pełni prompt w formacie robota — jak w modelu Psi-R2.5, gdzie pojedyncza demonstracja człowieka przekładana jest na format robota i wystarcza do adaptacji bez aktualizacji wag.
Trenowanie osobnej polityki dla każdego zadania manipulacyjnego jest niepraktyczne: wymaga setek demonstracji na zadanie albo ręcznej inżynierii cech. One-shot imitation learning pozwala pokryć całą rodzinę zadań jedną siecią i dołożyć nowe zadanie kosztem jednej demonstracji.
Zamiast jednego zadania sieć uczy się rodziny zadań z wieloma instancjami, co wymusza uogólnianie zamiast zapamiętywania.
Wejściem jest jedna demonstracja i bieżący stan, a celem — akcje zgodne z trajektorią drugiej demonstracji tego samego zadania.
Pozwala sieci odnosić bieżący stan do właściwych fragmentów demonstracji i uogólniać poza dane treningowe.
Oficjalna
Metoda uogólnia na nowe instancje zadań z rodziny widzianej w treningu; zadanie spoza tej rodziny zwykle wymaga ponownego treningu.
Skoro całe zadanie definiuje jedna demonstracja, jej szum, nietypowe tempo lub niepełne wykonanie przekładają się wprost na politykę.
Duan i współautorzy formułują paradygmat: metauczenie na rodzinach zadań, wejście w postaci jednej demonstracji i stanu, miękka uwaga jako mechanizm uogólniania.
Praca „One-Shot Imitation Learning with Invariance Matching for Robotic Manipulation" pokazuje generalizację na nowe kształty i transfer sim-to-real.
W modelu Psi-R2.5 pojedyncza demonstracja człowieka przekładana na format robota wystarcza do adaptacji zadania bez aktualizacji wag.