Chińska firma X Square Robot pokazała zintegrowany zestaw oprogramowania dla robotów ogólnego przeznaczenia i otworzyła jego kluczowe elementy. Rozwiązanie łączy trzy warstwy: zbieranie danych, model świata i model działania, wszystkie oparte na fizycznych zdarzeniach zamiast sztywnych klatek czasu. Kod modeli WALL-WM i Wall-OSS-0.5 trafił do otwartego repozytorium, a architekturę opisał w 2026 roku IEEE Spectrum.
Najważniejsze w skrócie
- Trzy warstwy: dane (system QUANXTA Zero), model świata WALL-WM, model działania Wall-OSS-0.5
- Podstawą danych jest interakcja realnie zmieniająca świat, a nie sama trajektoria ruchu
- Dane zbierane noszonym zestawem VR z dwoma chwytakami, nie klasyczną teleoperacją
- 85 procent zebranych trajektorii uznawanych za poprawne, przy około 20-krotnie niższym koszcie zbierania
- Wagi i kod WALL-WM oraz Wall-OSS-0.5 udostępnione jako open source
Trzy warstwy jednego fundamentu
Firma, założona pod koniec 2023 roku, jest dziś wyceniana na ponad 20 miliardów juanów (ok. 2,9 mld USD, czyli ok. 10,6 mld zł), jak podaje IEEE Spectrum. Jej fundament składa się z trzech zależnych od siebie warstw. Pierwsza to dane uczące zbierane systemem nazwanym QUANXTA Zero. Druga to model świata?model świata: Model, który przewiduje przyszłe stany otoczenia na podstawie obecnego — pozwala robotowi „wyobrazić sobie" skutek działania, zanim je wykona. WALL-WM, który przewiduje, co stanie się w otoczeniu. Trzecia to model działania Wall-OSS-0.5 — typu wizja-język-akcja, czyli łączący obraz, polecenie tekstowe i ruch. Firma stawia twarde założenie: model po wstępnym treningu ma działać na prawdziwym robocie jeszcze przed dostrajaniem do konkretnego zadania.
Zdarzenia zamiast klatek czasu
Najważniejsza różnica dotyczy tego, jak system rozumie zachowanie robota. Zamiast dzielić ruch na równe odcinki czasu, WALL-WM operuje na zdarzeniach — spójnych fragmentach działania, takich jak sięgnięcie, chwyt czy odłożenie przedmiotu. Model ma dwa tryby: zdarzeniowy do planowania długich sekwencji i stałej długości do sterowania w czasie rzeczywistym. Warstwy spina X-Tokenizer, który zamienia ruch na czytelne dla modelu językowego kody intencji. Dodanie szumu do ruchu niemal nie zmienia kodu intencji, dzięki czemu ten sam tokenizer można wykorzystać na różnych robotach bez ponownego strojenia.
Dane z realnego robota
Zamiast klasycznej teleoperacji X Square Robot zbiera pokazy noszonym zestawem VR z dwoma chwytakami. Kluczowa jest kontrola jakości: próbkę nagranych trajektorii odtwarza się na prawdziwym robocie i liczą się tylko te, które faktycznie kończą zadanie. Firma podaje 85 procent poprawnych trajektorii oraz wynik porównywalny ze zbiorami czysto robotycznymi przy około 20-krotnie niższym koszcie zbierania. Kod modeli i dokumentacja infrastruktury danych są dostępne publicznie, bo — jak podkreśla firma — inteligencji ucieleśnionej nie rozwiąże jedna organizacja.
Dlaczego to ważne?
Rynek robotów humanoidalnych pełen jest efektownych demonstracji, ale brakuje wspólnej warstwy oprogramowania, na której można budować. Propozycja X Square Robot celuje właśnie w tę lukę: zamiast pojedynczego modelu oferuje cały łańcuch od danych po działanie. Otwarcie kodu to zakład, że standard wygra ten, wokół kogo zbuduje się społeczność, a nie ten, kto zamknie technologię. Nacisk na zdarzenia i tani sposób zbierania danych odpowiada na dwa realne wąskie gardła robotyki: koszt danych i przenoszenie umiejętności między różnymi maszynami.
Co dalej?
- Firma wskazuje trzy pytania do weryfikacji przez społeczność, m.in. czy reprezentacje zdarzeniowe uogólniają się na nowe zadania i obiekty
- Otwartym pytaniem pozostaje, czy trening przenosi się na roboty o innej budowie niż użyte w danych
- X Square Robot chce, by ocena na prawdziwych robotach stała się wspólnym standardem branży
Źródła
- IEEE Spectrum — Building a Foundation Stack for General-Purpose Robots
- X Square Robot — About
- GitHub — X-Square-Robot/wall-x





