X Square Robot, chińska firma z Shenzhen wyceniana na ponad 20 mld juanów (ok. 2,9 mld USD, ok. 11,6 mld zł), opisała i udostępniła swój stos embodied AI dla robotów ogólnego przeznaczenia. Zamiast jednego modelu firma stawia na trzy sprzężone warstwy: tanie zbieranie danych, model świata WALL-WM oraz model akcji Wall-OSS. Materiał opisujący to podejście ukazał się w połowie lipca 2026 roku.
Najważniejsze w skrócie
- Stos składa się z trzech warstw: dane, model świata WALL-WM, model akcji Wall-OSS-0.5.
- Dane zbierane bez robota, przez noszony rig VR z dwoma chwytakami (QUANXTA Zero) — koszt zbierania ok. 20 razy niższy niż w zestawach czysto robotowych.
- Walidacja przez odtworzenie na prawdziwym robocie daje ok. 85 procent poprawnych próbek.
- WALL-WM modeluje zdarzenia (sięgnięcie, chwyt, odłożenie), a nie stałe okna czasowe.
- Wall-OSS-0.5 to model vision-language-action gotowy do działania jeszcze przed fine-tuningiem pod konkretne zadanie.
Trzy warstwy jednego stosu
Firma powstała w 2023 roku i buduje własną rodzinę modeli WALL wokół jednej tezy: przewagi w robotyce ogólnego przeznaczenia nie da samo skalowanie modelu, lecz spójny stos danych, modelu świata i modelu akcji. Podstawową jednostką nie jest tu trajektoria ruchu, ale interakcja, czyli skuteczna zmiana stanu świata.
Dane, a nie rozmiar modelu, są prawdziwym wąskim gardłem robotów ogólnego przeznaczenia.
Teza z opisu stosu embodied AI X Square Robot.
Dane bez robota, za 1/20 kosztu
Pierwsza warstwa to zbieranie danych. Zamiast żmudnej teleoperacji robotów X Square Robot używa noszonego rigu VR z dwoma chwytakami (system QUANXTA Zero, oparty na koncepcji Universal Manipulation Interface). Człowiek wykonuje zadania bezpośrednio, a nagrania trafiają do treningu bez udziału robota.
Kluczowa jest kontrola jakości. Zebrane dane są odtwarzane na prawdziwym robocie, co odsiewa próbki niewykonalne fizycznie i daje około 85 procent poprawnych demonstracji. Według firmy taki sposób zbierania jest około 20 razy tańszy niż budowanie zbioru wyłącznie na robotach. Strategia to trening wstępny na demonstracjach bez robota, a następnie zakotwiczenie małym zbiorem danych z prawdziwego sprzętu.
WALL-WM: model świata liczony zdarzeniami
Druga warstwa to model świata WALL-WM. Jego główna różnica wobec typowych podejść polega na modelowaniu zdarzeń, a nie stałych okien czasowych. Zamiast dzielić nagranie na równe odcinki czasu, model opisuje spójne zachowania: sięgnięcie, chwyt, odłożenie. Dzięki temu może rozumować nad długim horyzontem działania.
Architektonicznie WALL-WM to model text-to-video sprzężony ze świeżo zainicjowaną siecią akcji, co pozwala zachować wizualne priory?wizualne priory: wiedza o wyglądzie świata wyuczona wcześniej na dużym zbiorze wideo, zachowywana przy dalszym treningu. z pretreningu wideo. Model działa w dwóch trybach: zdarzeniowym, z odcinkami o zmiennej długości do rozumowania długoterminowego, oraz o stałej długości, do sterowania robotem w czasie rzeczywistym.
Wall-OSS i X-Tokenizer: akcja gotowa przed strojeniem
Trzecia warstwa to model akcji Wall-OSS-0.5, czyli vision-language-action. Jego założeniem jest użyteczność jeszcze przed fine-tuningiem pod konkretne zadanie. Model trenowany jest jednocześnie na trzech celach: dyskretnych tokenach akcji, ugruntowaniu języka oraz generowaniu ciągłej akcji.
Spina to X-Tokenizer, semantyczny interfejs z hierarchicznymi kodami intencji i szczegółu. Warstwa pośrednia opisuje działanie w kategoriach zbliżania, kontaktu, siły i odzyskiwania po błędzie, co ma pozwolić przenosić model między różnymi robotami bez ponownego strojenia. To odpowiedź na klasyczny problem cross-embodiment: różnice w częstotliwości sterowania, opóźnieniu, podatności i czujnikach.
Dlaczego to ważne?
Większość zespołów pracujących nad modelami VLA skupia się na skali i architekturze samego modelu. X Square Robot przesuwa punkt ciężkości na dane i sposób ich reprezentacji, twierdząc, że to tam leży realne wąskie gardło. Jeśli teza się potwierdzi, tańsze zbieranie danych bez robota może znacząco obniżyć próg wejścia dla całej branży.
Modelowanie zdarzeń zamiast okien czasowych to również argument w toczącej się dyskusji o tym, czym w ogóle powinien być model świata dla robota. Wreszcie nacisk na odzyskiwanie po błędzie, a nie tylko na surową skuteczność, dobrze oddaje realia domu i magazynu, które nie resetują się po nieudanej próbie. Otwarte udostępnienie kodu pozwala niezależnym zespołom zweryfikować te deklaracje, co jest istotne, bo firma testuje na razie głównie na własnych robotach i benchmarkach.
Co dalej?
- Kod stosu został udostępniony do testów i reprodukcji przez społeczność — pierwszym testem będą niezależne wyniki poza benchmarkami firmy.
- Brak niezależnych benchmarków firm trzecich — to najważniejsza luka do zamknięcia przy ocenie realnej generalizacji.
- X Square Robot rozwija własne roboty (m.in. Quanta X2 i Quanta X1 Pro) — wdrożenia stosu na tym sprzęcie pokażą, czy transfer między platformami działa w praktyce.
Źródła
- IEEE Spectrum — Building a Foundation Stack for General-Purpose Robots
- X Square Robot — Official site: robots and WALL foundation model





