Robocikowo>ROBOCIKOWO
DreamerV2

DreamerV2

2 · Rodzina: Dreamer
Model-based RL agent uczący world model z dyskretnymi latentami (RSSM); pierwszy agent osiągający poziom ludzki na benchmarku Atari na pojedynczym GPU.
🔬 Research✓ Publiczny dostęp⚖ Open sourceModel świata📁 Dreamer
Data premiery
5 października 2020
Dostęp:DownloadWdrożenie:💻 Lokalnie

Przegląd

DreamerV2 to agent uczenia ze wzmocnieniem oparty o model świata, opracowany przez Danijara Hafnera, Timothy'ego Lillicrapa, Mohammada Norouziego i Jimmy'ego Ba. Zaprezentowany w preprintcie z 5 października 2020 (arXiv:2010.02193, „Mastering Atari with Discrete World Models") i opublikowany na konferencji ICLR 2021.

Model uczy się kompaktowej reprezentacji środowiska z surowych obserwacji za pomocą rekurencyjnego modelu stanu (RSSM) z dyskretnymi (kategorialnymi) reprezentacjami latentnymi. Polityka typu actor-critic jest trenowana wyłącznie na trajektoriach generowanych „w wyobraźni" przez model świata, bez wykonywania tych akcji w prawdziwym środowisku.

Wyniki

DreamerV2 jest pierwszym agentem, który osiąga poziom ludzki na benchmarku Atari (55 gier, 200M klatek), ucząc się zachowań z osobno trenowanego modelu świata. Przy takim samym budżecie obliczeniowym i czasie rzeczywistym przewyższa czołowe agenty jednogpu-owe IQN i Rainbow. Model demonstruje też sterowanie ciągłe — kontrolę humanoidalnego robota wyłącznie z pikselowych wejść.

Dostępność

Implementacja referencyjna w TensorFlow 2 jest dostępna publicznie na GitHubie (danijar/dreamerv2) na licencji MIT i działa na pojedynczym GPU. DreamerV2 należy do linii Dreamer/PlaNet (world models) i został później zastąpiony przez DreamerV3.

Klasyfikacja
Model świata
Rodzina: Dreamer
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
📥 Wejście: obraz, dane strukturalne, dane stanu robota
Robotyka
Motion planningRobot controlEnvironment modelingSpatial prediction

Specyfikacja techniczna

Licencja
MIT
Wymagania sprzętowe
Trening na pojedynczym GPU (np. NVIDIA V100) na grę. Implementacja referencyjna w TensorFlow 2.
Modalności
⬇ Wejście (Input)
imagestructured_datarobot_state_data
⬆ Wyjście (Output)
robot_actionsstructured_data

Możliwości i zastosowania

Natywne możliwości modelu
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Robotyka
Motion planningRobot controlEnvironment modelingSpatial prediction

Wyniki benchmarków

2 benchmarki
Atari 200M (55 games)
wejście pikselowe, 200M klatek, pojedynczy GPU
human-level; surpasses Rainbow and IQN at equal compute
📄 DreamerV2 paper (arXiv:2010.02193)
DeepMind Control (humanoid, pixels)
sterowanie ciągłe z samych pikseli
continuous control from pixel-only inputs
📄 DreamerV2 paper (arXiv:2010.02193)

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)