Robocikowo>ROBOCIKOWO
DR

DreamZero

23B (DROID / AgiBot)
„World Action Model” (23B) na bazie dyfuzji wideo Wan2.1: wspólnie przewiduje przyszłe klatki świata i akcje robota, dając 2× lepszą generalizację zero-shot niż czołowe VLA.
🔬 Research🔬 Research only⚖ Open weightsModel świataModel wzrok-język-akcjaBazowy model robotyczny
Parametry
23B
parametrów
Data premiery
17 lutego 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie

Przegląd

DreamZero to „World Action Model” (WAM) — hybryda modelu świata i uczenia polityki robota. Zamiast typowego mapowania obserwacji na akcje (jak w modelach wizja-język-akcja), DreamZero wspólnie przewiduje przyszłe stany świata i akcje, używając wideo jako gęstej reprezentacji tego, jak zmienia się otoczenie.

Model zbudowano na szkielecie dyfuzji wideo Wan2.1-I2V (14B), a całość liczy 23 mld parametrów (BF16). Składa się z VAE do kodowania wizualnego, enkodera tekstu dla instrukcji językowych oraz wejścia stanu proprioceptywnego robota; wyjściem jest autoregresyjna, wspólna predykcja przyszłych klatek wideo i akcji robota.

DreamZero trenowano wyłącznie na zbiorze DROID (~75 tys. epizodów z adnotacjami językowymi), bez masowego pretrenowania — co pokazuje skuteczność uczenia z heterogenicznych danych robotycznych bez wysoce powtarzalnych demonstracji. Twórcy raportują 2× lepszą generalizację zero-shot względem czołowych modeli VLA oraz sterowanie w pętli zamkniętej ~7 Hz. Wagi udostępniono na licencji CC-BY-NC-4.0 (niekomercyjnej).

Klasyfikacja
Model świataModel wzrok-język-akcjaBazowy model robotyczny
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 23B
✓ Fine-tuning
📥 Wejście: wideo, obraz, tekst, dane stanu robota

Specyfikacja techniczna

Parametry
23B
parametrów
Licencja
CC-BY-NC-4.0
Wymagania sprzętowe
Wagi 23B w BF16 (safetensors), szkielet dyfuzji wideo Wan2.1-I2V; sterowanie w pętli zamkniętej ~7 Hz po optymalizacjach.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
videoimagetextrobot_state_data
⬆ Wyjście (Output)
videorobot_actionsmotion_trajectories

Możliwości i zastosowania

Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Symulacja świata
Zdolność modelu do generowania spójnych, interaktywnych symulacji środowisk fizycznych — utrzymywanie geometrii, oświetlenia i fizyki podczas eksploracji.
Kategoria: multimodal
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding

Wyniki benchmarków

2 benchmarki
Generalizacja zero-shot vs SOTA VLA
zero-shot
📄 paper
Dwukrotna poprawa generalizacji zero-shot względem czołowych VLA wg publikacji (2026).
Sterowanie w pętli zamkniętej
~7 Hz
📄 paper
Częstotliwość sterowania closed-loop po optymalizacjach.

Architektura techniczna

Forma modelu (Model Form)
Techniki trenowania (Training Techniques)