Mechanizm łączy opisy Skild z ugruntowanymi metodami akademickimi. (1) Ogromny, wieloucieleśnieniowy rozkład treningowy: Skild deklaruje trening we „wszechświecie 100 000 różnych robotów" (proceduralnie generowane morfologie) z agresywną randomizacją domeny, uzupełniony pre-treningiem na wideo z internetu (w tym ludzi traktowanych jako forma robota) oraz docelowymi danymi realnymi/teleoperacją. (2) Ucieleśnieniowo-ogólna reprezentacja obserwacji i akcji: zamiast sztywnego wektora stanu/akcji przypisanego do jednego ciała, polityka przyjmuje lokalne obserwacje per-aktuator lub deskryptory morfologii, więc ta sama sieć obsługuje różną liczbę stopni swobody. (3) Warunkowanie morfologią i wnioskowanie ciała w kontekście: model wnioskuje nieznane ciało z historii sensomotorycznej, a nie z podanej kinematyki; LocoFormer stosuje długokontekstowe Transformery, których kontekst przekracza granice epizodów, umożliwiając adaptację w czasie testu. (4) Hierarchiczny stos polityk (Skild Brain): wolna polityka wysokiego poziomu (intencja nawigacji/manipulacji) steruje szybką polityką niskiego poziomu wyznaczającą kąty stawów/momenty silników. (5) Adaptacja w kontekście podczas wdrożenia: kompensacja utraconej kończyny w ~7–8 s, przejście do chodu na trzech nogach w 2–3 s, wykrycie zablokowanego koła — na robotach spoza zbioru treningowego (zero-shot). (6) W przypadku manipulacji S1 specyfikuje zadanie przez uczenie w kontekście z pojedynczego wideo demonstracyjnego zamiast języka.
Klasyczne kontrolery przeuczają się do jednej morfologii i jednego zadania — każdy nowy robot, nowy czujnik czy nawet uszkodzenie sprzętu wymaga zebrania nowych danych i ponownego treningu. Omni-bodied Learning amortyzuje ten koszt w jednym, wielokrotnie używalnym modelu, który wykorzystuje pozytywny transfer między ucieleśnieniami i pozwala uniknąć budowy osobnej polityki dla każdego robota.
Ogromny zbiór łączący proceduralnie generowane morfologie w symulacji, wideo z internetu (w tym ludzi) oraz realne dane/teleoperację; podstawa transferu między ciałami.
Przyjmuje lokalne obserwacje per-aktuator lub deskryptory morfologii, aby ta sama sieć obsługiwała różną liczbę stopni swobody i typów czujników.
Oficjalna
Transformer z kontekstem przekraczającym granice epizodów wnioskuje nieznane ciało i kompensuje uszkodzenia sprzętu bez retreningu (mechanizm LocoFormer).
Oficjalna
Hierarchiczny stos: wolna polityka wysokiego poziomu (intencja) steruje szybką polityką niskiego poziomu wyznaczającą kąty stawów/momenty silników.
Sposób zadania celu: S1 używa uczenia w kontekście z pojedynczego wideo demonstracyjnego; inne polityki generalistyczne używają języka lub obrazu-celu.
Oficjalna
Transfer między bardzo różnymi ciałami (ramię vs czworonóg) potrafi szkodzić zamiast pomagać; pozytywny transfer nie jest automatyczny.
Różna liczba stopni swobody, typy czujników i częstotliwości sterowania muszą zostać sprowadzone do wspólnej reprezentacji.
Kilka bogatych w dane ucieleśnień dominuje, a rzadkie morfologie są niedouczone.
Wszechświat 100 000 robotów jest symulowany; potrzebna jest agresywna randomizacja domeny i post-trening na danych realnych.
Ciało trzeba wywnioskować z historii sensomotorycznej, co wymaga długiego kontekstu i podnosi koszt inferencji.
Shared Modular Policies („One Policy to Control Them All", Huang, Mordatch, Pathak, ICML 2020) — jedna polityka dla hopperów, czworonogów i bipedów.
MetaMorph (A. Gupta, Fan, Ganguli, Fei-Fei, ICLR 2022) — Transformer tokenizujący morfologię, generalizujący na niewidziane ucieleśnienia.
Open X-Embodiment / RT-X (22 ucieleśnienia, 21+ instytucji) wykazuje pozytywny transfer między robotami — fundament danych dla polityk generalistycznych.
Octo (maj 2024) i OpenVLA (czerwiec 2024) oraz π0 Physical Intelligence (paź. 2024) — generalistyczne polityki manipulacji trenowane na wielorobotowych danych.
Skild AI (Deepak Pathak, Abhinav Gupta, CMU) ogłasza rundę Series A ($300M, wycena $1,5B) i „general-purpose brain for robots".
Blog „The case for an omni-bodied robot brain" (24 wrz. 2025): trening na 100 000 robotów i adaptacja w kontekście do uszkodzeń — źródło marki terminu.
LocoFormer (Liu, Pathak, Agarwal) — generalistyczny model lokomocji dla nieznanych robotów nożnych i kołowych z adaptacją długokontekstową; recenzowane zaplecze marki Skild.
Skild przedstawia S1 uczący zadań z pojedynczej demonstracji wideo w kontekście; deklarowane 66% skuteczności na nieznanych zadaniach wobec 9% baseline’u (dane firmowe).
Długi kontekst przekraczający granice epizodów to główna dźwignia adaptacji w kontekście w LocoFormer.
Liczba i zróżnicowanie ucieleśnień treningowych; Skild deklaruje ~100 000 różnych robotów.
Rozpiętość randomizacji fizyki/sensoryki niezbędna do transferu sim-to-real na nieznane ciała.
Wolna polityka wysokiego poziomu vs szybka polityka niskiego poziomu w hierarchicznym stosie.
Udział symulacji, wideo z internetu i realnej teleoperacji; Skild podaje ~1$ zbierania : 3$ kontroli jakości.
W S1 pojedyncza demonstracja wideo w kontekście zastępuje — wg Skild — ok. 380 przykładów po-treningowych.
Gęsta sieć (zwykle Transformer); wyjście zależne od wejścia dzięki warunkowaniu morfologią i adaptacji w kontekście.
Brak routingu ekspertów; zachowanie jest warunkowane wnioskowanym w kontekście ciałem, a nie bramkowaniem eksperckim.
Trening RL/imitacyjny zrównolegla się trywialnie po morfologiach i środowiskach symulacyjnych na dużych klastrach GPU.
Masowo równoległy trening RL w symulacji oraz pre-trening na wideo wymagają dużych klastrów GPU.
Wdrożenie działa jako inferencja na wbudowanym sprzęcie robota; koncept abstrahuje od konkretnego ucieleśnienia, a Skild udostępnia umiejętności przez API.