Robocikowo>ROBOCIKOWO
PlaNet

PlaNet

Model-based agent RL od Google (Danijar Hafner i in., 2019), który uczy się modelu świata z pikseli i planuje w przestrzeni latentnej.
🔬 Research🔬 Research only⚖ Open sourceModel świata
Data premiery
15 lutego 2019
Dostęp:DownloadWdrożenie:💻 Lokalnie

Przegląd

PlaNet (Deep Planning Network) to model-based agent uczenia ze wzmocnieniem opracowany przez badaczy Google i DeepMind (Danijar Hafner i inni), przedstawiony w 2019 roku w pracy „Learning Latent Dynamics for Planning from Pixels” (ICML 2019). Agent uczy się modelu świata wyłącznie z obrazów (pikseli) i wykorzystuje go do planowania działań.

Sercem modelu jest Recurrent State-Space Model (RSSM) — latentny model dynamiki łączący komponent deterministyczny i stochastyczny, co pozwala przewidywać wiele możliwych przyszłości i pamiętać informacje przez wiele kroków. Planowanie odbywa się w przestrzeni latentnej: agent porównuje tysiące wyobrażonych sekwencji działań, wybiera najlepszą, wykonuje ją i przeplanowuje po każdej nowej obserwacji.

PlaNet trenowano na zadaniach ciągłej kontroli z DeepMind Control Suite (m.in. cartpole swingup, finger spin, cheetah run, cup catch, walker walk, reacher). Osiąga wyniki zbliżone do model-free D4PG przy około 50-krotnie mniejszej liczbie interakcji ze środowiskiem. Kod referencyjny opublikowano na licencji Apache 2.0; PlaNet jest poprzednikiem linii modeli Dreamer.

Klasyfikacja
Model świata
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
📥 Wejście: obraz

Specyfikacja techniczna

Licencja
Apache-2.0
Wymagania sprzętowe
Referencyjna implementacja w TensorFlow 1.13.1 (TensorFlow Probability, dm_control, gym).
Modalności
⬇ Wejście (Input)
image
⬆ Wyjście (Output)
robot_actionsmotion_trajectories

Możliwości i zastosowania

Natywne możliwości modelu
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Symulacja świata
Zdolność modelu do generowania spójnych, interaktywnych symulacji środowisk fizycznych — utrzymywanie geometrii, oświetlenia i fizyki podczas eksploracji.
Kategoria: multimodal
Efektywność próbkowa
Zdolność do osiągania wysokiej wydajności przy znacznie mniejszej liczbie interakcji ze środowiskiem lub przykładów uczących.
Kategoria: other

Wyniki benchmarków

1 benchmark
DeepMind Control Suite (6 zadań ciągłej kontroli, z pikseli)
efektywność próbkowa · Ciągła kontrola z obrazów; ~50x mniej epizodów niż model-free D4PG/A3C
≈ D4PG
📅 15 lut 2019📄 Google Research Blog / ICML 2019
PlaNet osiąga wynik zbliżony do D4PG przy ok. 5000% mniejszej liczbie interakcji ze środowiskiem. Zadania: cartpole swingup, finger spin, cheetah run, cup catch, walker walk, reacher.