1) Ludzie nagrywaja czynnosci kamera noszona z perspektywy pierwszej osoby (opcjonalnie z audio, IMU, sledzeniem wzroku). 2) Dane sa kurowane i (opcjonalnie) anotowane: narracje, akcje, interakcje reka-obiekt. 3) Model uczy sie z wideo — samonadzorowanie / video pretraining lub uczenie z demonstracji — nabywajac reprezentacje dynamiki, obiektow i czynnosci. 4) Reprezentacje/polityki sa przenoszone (transfer/fine-tuning) na robota, z uwzglednieniem luki wcielenia (retargeting reki-chwytaka, dostrojenie na niewielkiej ilosci danych robota).
Demonstracje zbierane na robocie (teleoperacja) sa kosztowne i trudno skalowalne. Egocentryczne wideo czlowieka dostarcza taniego, obszernego i zgodnego z perspektywa robota zrodla danych o manipulacji i zachowaniu w swiecie.
Kamera noszona na glowie/ciele rejestrujaca scene z perspektywy pierwszej osoby (opcjonalnie z IMU, audio, sledzeniem wzroku).
Oficjalna
Wykurowany, wielkoskalowy zbior nagran egocentrycznych, czesto z anotacjami (narracje, akcje, interakcje).
Oficjalna
Proces uczenia z wideo (pretraining/SSL lub imitation) i transferu reprezentacji/polityk na robota.
Oficjalna
Rece i cialo czlowieka roznia sie od chwytaka/robota, co utrudnia bezposredni transfer polityk.
Czyste wideo nie zawiera komend sterujacych ani stanu ciala, co ogranicza bezposrednie uczenie polityk.
Nagrania z pierwszej osoby moga zawierac dane wrazliwe i byc obciazone stronniczoscia domenowa.
Wielkoskalowy egocentryczny zbior nagran czynnosci kuchennych upowszechnia egocentryczne wideo w badaniach.
Meta i konsorcjum publikuja Ego4D, masowy zbior egocentrycznego wideo, ustanawiajac je jako zrodlo treningowe dla embodied AI.
Egocentryczne (i human) wideo staje sie powszechnym paliwem pretreningu dla modeli VLA i wideo-akcja (VAM), obok Ego-Exo4D.
Złożoność czasowa: Zalezna od skali danych i modelu. Złożoność przestrzenna: O(godziny × rozdzielczosc × FPS).
Przetwarzanie/przechowywanie wielkoskalowego wideo jest kosztowne, a roznica miedzy morfologia czlowieka a robota (embodiment gap) oraz brak jawnych akcji/proprioceptywnych etykiet utrudniaja bezposredni transfer.
RGB, opcjonalnie audio, IMU, sledzenie wzroku, glebia.
Narracje, etykiety akcji, interakcje reka-obiekt, brak (samonadzorowanie).
Ilosc nagran; kluczowa dla jakosci pretreningu.
Dotyczy fazy treningu (uczenie z wideo).
Brak routingu — strategia danych treningowych.
Pretraining na wideo jest silnie zrownoleglony (dane i model).
Trening modeli na wielkoskalowym wideo jest bardzo intensywny obliczeniowo i korzysta z akceleratorow GPU/TPU.