Człowiek wykonuje zadanie trzymając ręczny chwytak równoległy z zamontowaną kamerą GoPro (obiektyw rybie oko), IMU i bocznymi lusterkami zwiększającymi pole widzenia. Ruch chwytaka jest odtwarzany metodą wizyjno-inercyjną (SLAM) do trajektorii 6-DoF, a szerokość chwytu z obrazu. Zebrane demonstracje służą do wyuczenia polityki dyfuzyjnej (diffusion policy) metodą uczenia przez naśladowanie. Na etapie wdrożenia stosuje się dopasowanie opóźnień (latency matching) obserwacji i akcji oraz reprezentację akcji względem bieżącej trajektorii, dzięki czemu ta sama polityka działa na różnych ramionach robotycznych.
Zbieranie danych do nauki manipulacji zwykle wymaga drogiego robota i teleoperacji, co jest wolne i ogranicza różnorodność środowisk. UMI usuwa potrzebę robota na etapie zbierania danych — demonstracje nagrywa człowiek tanim chwytakiem (~30 s na demonstrację, ponad 3× szybciej niż teleoperacja), zachowując możliwość wdrożenia na realnym robocie.
Przenośne, tanie urządzenie trzymane w ręce, odwzorowujące chwytak robota, używane do nagrywania demonstracji.
Szerokokątna kamera na nadgarstku rejestrująca obraz sceny z punktu widzenia chwytaka.
Czujnik inercyjny wspierający odtwarzanie ruchu chwytaka (tracking wizyjno-inercyjny).
Lusterka rozszerzające efektywne pole widzenia kamery o widoki boczne sceny.
Warstwa uczenia i wdrożenia oparta na diffusion policy, z dopasowaniem opóźnień i reprezentacją akcji względem trajektorii.
Słabe oświetlenie, rozmycie ruchu lub brak tekstury mogą powodować dryf lub utratę śledzenia trajektorii chwytaka.
Różnica opóźnień między nagraniem a robotem docelowym pogarsza działanie polityki, jeśli nie jest skompensowana.
Różnice kinematyki i dynamiki między ręcznym chwytakiem a ramieniem robota mogą ograniczać transfer.
Prezentacja UMI na RSS 2024; finalista nagrody Best Systems Paper. Otwarty sprzęt i oprogramowanie.
Rozszerzenie UMI na manipulację mobilną z robotami kroczącymi/kwadrupedami.
Odtworzenie trajektorii 6-DoF chwytaka z obrazu rybie oko i IMU jest kluczowym i wrażliwym krokiem przetwarzania danych; jego jakość decyduje o użyteczności demonstracji.
Liczba ostatnich klatek obserwacji podawanych polityce.
Liczba kroków akcji przewidywanych naraz przez politykę dyfuzyjną.
Kompensacja różnicy opóźnień obserwacji i wykonania między nagraniem a robotem docelowym.
Uczenie i inferencja polityki dyfuzyjnej wymaga akceleracji GPU.