Robocikowo>ROBOCIKOWO
WALL-WM

WALL-WM

WALL-WM · Rodzina: WALL
Otwarty (Apache-2.0) model działania świata X Square Robot (seria WALL): event-grounded pretrening VLA, predykcja wideo i akcji, optymalizator Muon.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel świataBazowy model robotycznyModel wzrok-język-akcja📁 WALL
Data premiery
29 maja 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie📱 Na urządzeniu

Przegląd

WALL-WM to otwarty (open-source) model działania świata (world action model) dla ucieleśnionej AI ogólnego przeznaczenia, opracowany przez X Square Robot (自变量机器人, Shenzhen) i udostępniony 29 maja 2026 r. Należy do serii WALL i został opisany w pracy „WALL-WM: Carving World Action Modeling at the Event Joints” (arXiv:2606.01955).

Kluczową ideą jest przejście od uczenia opartego na sztywnych blokach czasowych (chunk-centric) do pretreningu wizualno-językowo-akcyjnego ugruntowanego w zdarzeniach (event-grounded), w którym atomową jednostką uczenia jest spójne semantycznie zdarzenie akcji (np. chwyt, podniesienie). Dzięki temu model uczy się celów zadania, a nie zapamiętywania sekwencji pikseli, i lepiej godzi semantykę języka, ciągłą dynamikę obrazu oraz akcje na poziomie sterowania.

Model łączy predykcję wideo z predykcją akcji na granicach zdarzeń. Oferuje dwa tryby inferencji: tryb zdarzeniowy (o zmiennej długości) oraz tryb zunifikowany z dekodowaniem schodkowym (Staircase Decoding). Wykorzystuje infrastrukturę pretreningu opartą na optymalizatorze Muon oraz architekturę trójwarstwową.

WALL-WM jest udostępniony na licencji Apache-2.0 wraz z kodem i narzędziami (GitHub wall-x, Hugging Face), co pozwala na komercyjne i niekomercyjne użycie, samodzielne uruchamianie oraz dostrajanie. Model uzupełnia serię WALL o zdolność modelowania świata i przewidywania skutków działań na potrzeby planowania i uczenia polityk robotów.

Klasyfikacja
Model świataBazowy model robotycznyModel wzrok-język-akcja
Rodzina: WALL
Dostęp i wdrożenie
Pobieranie
LokalnieNa urządzeniu
Wagi: Open source
Kluczowe parametry
✓ Fine-tuning
📥 Wejście: tekst, obraz, wideo, dane stanu robota
Robotyka
Environment modelingSpatial predictionMotion planningEmbodied task planningRobot manipulation

Specyfikacja techniczna

Licencja
Apache-2.0
Wymagania sprzętowe
Model open-source wdrażany lokalnie/on-device; trening i inferencja wymagają akceleracji GPU.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
textimagevideorobot_state_data
⬆ Wyjście (Output)
videorobot_actionsmotion_trajectories

Możliwości i zastosowania

Natywne możliwości modelu
Symulacja świata
Zdolność modelu do generowania spójnych, interaktywnych symulacji środowisk fizycznych — utrzymywanie geometrii, oświetlenia i fizyki podczas eksploracji.
Kategoria: multimodal
Generowanie wideo
Zdolność modelu do generowania klipów wideo z opisu tekstowego, obrazu lub innego wideo, z kontrolą długości, rozdzielczości i charakterystyk wizualnych.
Kategoria: video
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Robotyka
Environment modelingSpatial predictionMotion planningEmbodied task planningRobot manipulation

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)

Wdrożenie i bezpieczeństwo

☁ Dostępny na platformach