DR
„World Action Model” (23B) na bazie dyfuzji wideo Wan2.1: wspólnie przewiduje przyszłe klatki świata i akcje robota, dając 2× lepszą generalizację zero-shot niż czołowe VLA.
🔬 Research🔬 Research only⚖ Open weightsModel świataModel wzrok-język-akcjaBazowy model robotyczny
Parametry
23B
parametrów
Data premiery
17 lutego 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie
Przegląd
Klasyfikacja
Model świataModel wzrok-język-akcjaBazowy model robotyczny
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 23B
✓ Fine-tuning
📥 Wejście: wideo, obraz, tekst, dane stanu robota
Specyfikacja techniczna
Parametry
23B
parametrów
Licencja
CC-BY-NC-4.0
Wymagania sprzętowe
Wagi 23B w BF16 (safetensors), szkielet dyfuzji wideo Wan2.1-I2V; sterowanie w pętli zamkniętej ~7 Hz po optymalizacjach.
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
videoimagetextrobot_state_data
⬆ Wyjście (Output)
videorobot_actionsmotion_trajectories
Możliwości i zastosowania
Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Symulacja świata
Zdolność modelu do generowania spójnych, interaktywnych symulacji środowisk fizycznych — utrzymywanie geometrii, oświetlenia i fizyki podczas eksploracji.
Kategoria: multimodal
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Wyniki benchmarków
2 benchmarki
Generalizacja zero-shot vs SOTA VLA
zero-shot
2×
📄 paper
Dwukrotna poprawa generalizacji zero-shot względem czołowych VLA wg publikacji (2026).
Sterowanie w pętli zamkniętej
~7 Hz
📄 paper
Częstotliwość sterowania closed-loop po optymalizacjach.
Architektura techniczna
Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)