Zamiast łączyć osobno wytrenowane moduły, World Unified Model uczy jednej sieci reprezentującej łącznie: percepcję (przetwarzanie danych sensorycznych), język (rozumienie instrukcji i rozumowanie), akcję (sterowanie ruchem robota) oraz predykcję fizyczną (przewidywanie skutków działań w świecie). Dzięki wspólnemu treningowi model buduje spójną reprezentację, w której rozumowanie i działanie są ugruntowane w tej samej przestrzeni. Architektura jest realizowana w modelach WALL (np. WALL-B) o skali miliardów parametrów, wspierających generalizację między zadaniami i scenariuszami.
Klasyczne systemy robotyczne łączą oddzielne moduły wizji, języka i sterowania, co utrudnia spójne przenoszenie informacji między nimi i generalizację. WUM integruje te funkcje w jednej sieci, umożliwiając natywnie multimodalne, end-to-end sterowanie oraz uwzględnienie predykcji fizycznej (konsekwencji działań) w jednym modelu.
Przetwarzanie danych sensorycznych (wizja i inne modalności) w ramach wspólnej sieci.
Rozumienie instrukcji w języku naturalnym i rozumowanie (w tym przestrzenne i przyczynowe).
Generowanie precyzyjnych akcji sterujących robotem, w tym kontrola siły i pozycjonowanie.
Przewidywanie skutków działań w świecie (element modelowania świata) trenowane w tej samej sieci.
Jedna sieć trenowana łącznie, zastępująca oddzielne moduły wizji/języka/akcji.
Zunifikowana sieć end-to-end jest trudniejsza do analizy i naprawy niż architektura modułowa z rozdzielonymi komponentami.
Wspólny trening wielu modalności wymaga dużych, zróżnicowanych danych ucieleśnionych i znacznych zasobów obliczeniowych.
Duża część wyników i twierdzeń pochodzi od producenta i wymaga niezależnej weryfikacji.
Otwarty model wizualno-językowo-akcyjny X Square Robot (wrzesień 2025) — wcześniejszy etap serii WALL.
Model WALL-B (kwiecień 2026, Pekin) wprowadza architekturę World Unified Model trenującą percepcję, język, akcję i predykcję fizyczną w jednej sieci.
Łączny trening percepcji, języka, akcji i predykcji fizycznej w jednej sieci o skali miliardów parametrów jest kosztowny obliczeniowo i wymaga dużych, zróżnicowanych danych ucieleśnionych.
Wielkość modelu; modele WALL działają w skali miliardów parametrów.
Które funkcje są trenowane wspólnie w jednej sieci.
Zunifikowana, gęsta sieć end-to-end przetwarza wszystkie modalności w jednym przebiegu, bez oddzielnych modułów.
Trening dużej sieci jest silnie równoległy na klastrach GPU, ale sterowanie w pętli percepcja–akcja na robocie jest z natury sekwencyjne w czasie.
Trening i inferencja dużego, zunifikowanego modelu ucieleśnionego wymaga akceleracji GPU.