1) Nauczyciel (czlowiek) demonstruje zadanie: przez kinestetyczne prowadzenie ramienia, teleoperacje lub obserwowane nagranie. 2) System rejestruje demonstracje - trajektorie, sily, obraz, stan robota. 3) Z demonstracji wyodrebniana jest polityka/umiejetnosc (np. metodami imitation learning / behavior cloning). 4) Robot odtwarza i generalizuje zadanie; opcjonalnie doskonali sie dalej (np. przez dodatkowe demonstracje korygujace lub uczenie ze wzmocnieniem).
Reczne programowanie robota do kazdego nowego zadania jest wolne, kosztowne i wymaga ekspertow. Teaching by demonstration pozwala nietechnicznemu uzytkownikowi 'pokazac' zadanie, a robot uczy sie go z przykladow.
Sposob pokazania zadania: kinestetyczne prowadzenie, teleoperacja lub obserwacja wideo.
Oficjalna
Zapis trajektorii, sil, obrazu i stanu robota podczas pokazu.
Oficjalna
Przeksztalcenie demonstracji w polityke/umiejetnosc (np. imitation learning / BC).
Oficjalna
Robot odtwarza wyuczone zadanie i generalizuje je do nowych warunkow.
Oficjalna
Polityka uczona z demonstracji moze bladzic poza rozkladem demonstracji, kumulujac bledy (problem behavior cloning).
Rozne cialo/kinematyka czlowieka i robota utrudnia przeniesienie demonstracji (zwlaszcza z obserwacji).
Dobre demonstracje sa pracochlonne; niespojne lub nieoptymalne pokazy pogarszaja wyuczona polityke.
Wczesne prace nad programowaniem robotow przez demonstracje (m.in. teleoperacja i prowadzenie) w robotyce przemyslowej i badawczej.
Argall, Chernova, Veloso, Browning publikuja kanoniczny przeglad 'A survey of robot learning from demonstration', porzadkujac dziedzine.
Teleoperacja i demonstracje na skale zasilaja robotyczne modele fundamentalne i biblioteki umiejetnosci (embodied AI).
Złożoność czasowa: Nie dotyczy (paradygmat uczenia/HRI, nie algorytm). Złożoność przestrzenna: Nie dotyczy.
Skutecznosc zalezy przede wszystkim od jakosci i pokrycia demonstracji (dane), a nie od surowego computu; waskim gardlem jest kosztowne pozyskiwanie dobrych demonstracji i generalizacja poza rozklad.
Kinestetyczne prowadzenie, teleoperacja lub obserwacja (wideo).
Np. behavior cloning, inverse RL, dynamic movement primitives.
Ile pokazow potrzeba do wyuczenia i generalizacji zadania.
Opis dotyczy fazy odtwarzania wyuczonej polityki; sam paradygmat uczenia nie jest paradygmatem obliczeniowym.
Zbieranie demonstracji jest sekwencyjne (czlowiek), ale trening polityki i wiele stanowisk demonstracyjnych moga dzialac rownolegle.
To paradygmat uczenia/HRI - niezalezny od typu akceleratora; kinestetyczna demonstracja korzysta z napedu zwrotnego, a trening polityki moze wykorzystywac GPU.