Robocikowo>ROBOCIKOWO
Robotyka

Sim-to-Real

2017AktywnyOpublikowano: 24 sierpnia 2026Aktualizacja: 20 września 2026Opublikowany
Technika transferu w uczeniu maszynowym i robotyce: trenowanie modelu lub polityki sterowania w symulacji i przeniesienie jej na prawdziwego robota mimo różnic między symulacją a światem rzeczywistym ('reality gap').
Kluczowa innowacja
Umożliwienie taniego, bezpiecznego i masowego trenowania polityk sterowania w symulacji, a następnie ich przeniesienia na fizycznego robota — przez jawne domknięcie 'luki rzeczywistości' (reality gap), m.in. randomizacją domeny traktującą rzeczywistość jako kolejny wariant symulacji.
Kategoria
Robotyka
Poziom abstrakcji
Wzorzec
Poziom operacji
TreningSterowanie robotemModel
Zastosowania
Nauka lokomocji robotów kroczących (np. czworonogi, humanoidy)Manipulacja i chwyt dexterous (np. dłonie robotyczne)Nawigacja i unikanie kolizji dronów i robotów mobilnychPercepcja wizualna trenowana na danych syntetycznychMasowo równoległe trenowanie polityk na GPU

Jak działa

Typowy potok sim-to-real: (1) budowa symulatora fizyki i renderowania odwzorowującego robota i zadanie; (2) trening polityki w symulacji, zwykle uczeniem przez wzmacnianie na wielu równoległych instancjach; (3) domknięcie luki rzeczywistości jedną lub kilkoma metodami: randomizacją domeny (losowanie tekstur, mas, tarcia, opóźnień), adaptacją domeny (dostrojenie reprezentacji do danych rzeczywistych), identyfikacją systemu (kalibracja parametrów symulatora do pomiarów z realnego robota); (4) wdrożenie i ewaluacja na fizycznym robocie; (5) opcjonalne dostrojenie na małej ilości danych rzeczywistych. Wariant automatycznej randomizacji domeny (ADR) stopniowo zwiększa trudność, gdy polityka radzi sobie coraz lepiej.

Rozwiązany problem

Trenowanie robotów bezpośrednio na fizycznym sprzęcie jest wolne, kosztowne i ryzykowne (zużycie, awarie, bezpieczeństwo). Symulacja rozwiązuje to, dając nieograniczone dane, ale polityki wyuczone w symulacji zwykle zawodzą na prawdziwym robocie z powodu luki rzeczywistości. Sim-to-Real zamyka tę lukę, umożliwiając przeniesienie umiejętności z symulacji na sprzęt.

Komponenty

Randomizacja domenyDomykanie luki rzeczywistości

Losowe zmienianie parametrów symulacji (tekstury, oświetlenie, masy, tarcie, opóźnienia), by rzeczywistość jawiła się jako kolejny wariant treningowy.

Adaptacja domenyWyrównanie rozkładów

Dostrajanie reprezentacji lub polityki tak, by rozkład cech z symulacji zbliżył się do rozkładu z danych rzeczywistych.

Identyfikacja systemuWierność symulacji

Kalibracja parametrów symulatora (dynamika, tarcie, opóźnienia) do pomiarów z realnego robota, by symulacja lepiej odwzorowała sprzęt.

Symulator wysokiej wiernościŹródło danych treningowych

Silnik fizyki i renderowania (często masowo równoległy na GPU) generujący dane treningowe odwzorowujące robota i zadanie.

Implementacja

Pułapki implementacyjne
Luka rzeczywistości (reality gap)Wysoka

Nieodwzorowana fizyka, opóźnienia i szumy czujników sprawiają, że polityka świetna w symulacji zawodzi na sprzęcie.

Rozwiązanie:Identyfikacja systemu, randomizacja dynamiki i opóźnień oraz walidacja na prawdziwym robocie.
Nadmierna randomizacjaŚrednia

Zbyt szeroka randomizacja daje polityki nadmiernie zachowawcze i nieoptymalne w rzeczywistości.

Rozwiązanie:Automatyczna randomizacja domeny (ADR) i dobór zakresów w oparciu o dane rzeczywiste.

Ewolucja

Oryginalny paper · 2017 · IROS 2017 · Josh Tobin
Domain Randomization for Transferring Deep Neural Networks from Simulation to the Real World
Josh Tobin, Rachel Fong, Alex Ray, Jonas Schneider, Wojciech Zaremba, Pieter Abbeel
2016
CAD2RL — wczesny transfer z symulacji

Sadeghi i Levine pokazują lot bez kolizji wyuczony wyłącznie na losowo renderowanych obrazach z symulacji, bez ani jednego prawdziwego zdjęcia treningowego.

2017
Randomizacja domeny
Punkt przełomowy

Tobin i in. formalizują randomizację domeny, umożliwiając transfer sieci trenowanych wyłącznie na danych syntetycznych na rzeczywisty sprzęt.

2018
OpenAI Dactyl — manipulacja dexterous

OpenAI trenuje w symulacji z randomizacją domeny politykę manipulacji obiektem, przenosząc ją na fizyczną dłoń robotyczną Shadow Hand.

2019
Kostka Rubika i automatyczna randomizacja domeny

OpenAI rozwiązuje kostkę Rubika jedną robotyczną dłonią, wykorzystując automatyczną randomizację domeny (ADR) rosnącej trudności.

2020
Systematyzacja metod sim-to-real

Przegląd Zhao, Peña Queralta i Westerlunda porządkuje główne podejścia: randomizację i adaptację domeny, uczenie przez naśladowanie, meta-uczenie i destylację wiedzy.

2021
Masowo równoległa symulacja na GPU
Punkt przełomowy

NVIDIA Isaac Gym i prace nad lokomocją (np. czworonóg ANYmal) pokazują trening tysięcy równoległych środowisk na GPU i transfer polityk chodu na prawdziwe roboty w minuty.

Hiperparametry (konfigurowalne osie)

Zakresy randomizacji domenyKrytyczna

Rozpiętość i rozkład losowanych parametrów (tekstury, oświetlenie, masy, tarcie, opóźnienia). Zbyt wąskie zakresy nie domykają luki rzeczywistości, zbyt szerokie dają polityki nadmiernie zachowawcze.

±20% masy i tarciaTypowa randomizacja dynamiki w lokomocji.
Liczba równoległych środowiskWysoka

Ile instancji symulacji działa jednocześnie na GPU. Bezpośrednio wpływa na przepustowość danych i tempo treningu.

4096Rząd wielkości typowy dla treningu chodu na Isaac Gym.
Wierność symulacji vs prędkośćWysoka

Kompromis między dokładnością fizyki/renderowania a liczbą kroków na sekundę. Wyższa wierność zwęża lukę rzeczywistości kosztem szybkości.

Harmonogram automatycznej randomizacji (ADR)Średnia

Tempo, w jakim rozszerzane są zakresy randomizacji w miarę poprawy polityki. Kluczowe w podejściu OpenAI (kostka Rubika).

Budżet dostrajania na danych rzeczywistychŚrednia

Ilość danych z fizycznego robota użytych do opcjonalnego dostrojenia polityki po transferze. Często minimalna lub zerowa (zero-shot).

Wąskie gardło obliczeniowe

Przepustowość symulacji

Wąskim gardłem jest tempo generowania danych przez symulator — kroki fizyki i (opcjonalnie) renderowanie. Wierność fizyki, liczba równoległych środowisk oraz rozdzielczość renderowania wprost ograniczają, jak szybko powstają dane treningowe do uczenia przez wzmacnianie.

Zależy od
Wierność fizyki vs prędkośćLiczba równoległych środowisk

Równoległość

Poziom równoległości
W pełni równoległy

Największa przewaga sim-to-real: symulatory na GPU (np. NVIDIA Isaac Gym / Isaac Lab) uruchamiają tysiące równoległych środowisk jednocześnie, co daje ogromną przepustowość danych i skraca trening polityk z dni do minut. Faza wdrożenia (inference) na fizycznym robocie jest natomiast sekwencyjna — polityka działa w czasie rzeczywistym w pętli sterowania.

Zakres
Trening

Wymagania sprzętowe

Podstawowe

Masowo równoległa symulacja fizyki oraz trening polityk uczeniem przez wzmacnianie (np. Isaac Gym / Isaac Lab) wykonują się na GPU; tysiące środowisk naraz to domena kart graficznych.