Robocikowo>ROBOCIKOWO
Dreamer 4

Dreamer 4

4 · Rodzina: Dreamer
Skalowalny agent uczący się w wyobraźni wewnątrz szybkiego modelu świata; pierwszy zdobywa diamenty w Minecraft wyłącznie z danych offline.
🔬 Research🔬 Research onlyModel świata📁 Dreamer
Parametry
2B (400M tokenizer + 1.6B dynamics)
parametrów
Data premiery
29 września 2025

Przegląd

Dreamer 4 to skalowalny agent uczenia ze wzmocnieniem oparty o model świata, opracowany przez Danijara Hafnera, Wilsona Yana i Timothy’ego Lillicrapa (Google DeepMind). Zaprezentowany jako preprint arXiv (2509.24527) z 29 września 2025 roku. To kolejna generacja linii Dreamer po DreamerV3.

Agent uczy zachowań przez uczenie ze wzmocnieniem prowadzone „w wyobraźni” wewnątrz modelu świata, bez interakcji z prawdziwym środowiskiem. Model świata korzysta z przyczynowego tokenizera wideo (masked autoencoder kompresujący klatki do ciągłych reprezentacji) oraz wydajnej architektury transformera z nową funkcją celu „shortcut forcing”, dzięki czemu osiąga interaktywną inferencję w czasie rzeczywistym na pojedynczym GPU.

Wyniki

W grze Minecraft model świata trafnie przewiduje interakcje obiektów i mechanikę gry, wyraźnie przewyższając wcześniejsze modele świata. Autorzy stawiają wyzwanie zdobycia diamentów w Minecraft wyłącznie z danych offline — zadanie wymagające wyboru sekwencji ponad 20 000 akcji myszy i klawiatury na podstawie surowych pikseli. Ucząc się zachowań w wyobraźni, Dreamer 4 jako pierwszy agent zdobywa diamenty w Minecraft wyłącznie z danych offline, bez interakcji ze środowiskiem.

W trybie offline Dreamer 4 znacząco przewyższa agenta OpenAI VPT, używając przy tym 100 razy mniej danych, a także metody klonowania zachowań oparte na modelach wizyjno-językowych. Model świata uczy się warunkowania akcjami z niewielkiej ilości danych oznaczonych, większość wiedzy czerpiąc z różnorodnych nieoznaczonych nagrań wideo.

Praca jest motywowana zastosowaniami praktycznymi, m.in. robotyką, gdzie uczenie się przez interakcję ze środowiskiem bywa niebezpieczne i wolne. Model liczy 2 mld parametrów (400 mln tokenizer, 1,6 mld model dynamiki) i był trenowany na 256–1024 układach TPU-v5p.

Klasyfikacja
Model świata
Rodzina: Dreamer
Dostęp i wdrożenie
Wagi: Zamknięte
Kluczowe parametry
🧩 Parametry: 2B (400M tokenizer + 1.6B dynamics)
📥 Wejście: obraz, wideo, dane stanu robota
Robotyka
Environment modelingSpatial prediction

Specyfikacja techniczna

Parametry
2B (400M tokenizer + 1.6B dynamics)
parametrów
Wymagania sprzętowe
Trening na 256–1024 układach TPU-v5p (batch size 1 na urządzenie, sharding FSDP). Model świata osiąga interaktywną inferencję w czasie rzeczywistym na pojedynczym GPU.
Modalności
⬇ Wejście (Input)
imagevideorobot_state_data
⬆ Wyjście (Output)
videorobot_actions

Możliwości i zastosowania

Natywne możliwości modelu
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Robotyka
Environment modelingSpatial prediction

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)