Robocikowo>ROBOCIKOWO
WALL-A

WALL-A

WALL-A · Rodzina: WALL
Ucieleśniony model operacyjny X Square Robot (seria WALL): end-to-end, skala dziesiątek mld parametrów, architektura World Unified Model i X-Tokenizer. Manipulacja robotyczna.
✓ Aktywny🏢 EnterpriseBazowy model robotycznyModel wzrok-język-akcja📁 WALL
Parametry
百亿级 (skala dziesiątek miliardów, wg producenta)
parametrów
Wdrożenie:📱 Na urządzeniu💻 Lokalnie

Przegląd

WALL-A to ucieleśniony „model operacyjny” (操作大模型) rozwijany przez X Square Robot (自变量机器人, Shenzhen), stanowiący rdzeń serii modeli bazowych WALL. Firma opisuje go jako jedną z najwcześniejszych w pełni end-to-end implementacji ucieleśnionej AI w Chinach, integrującą percepcję, rozumienie i sterowanie działaniem w jednym modelu.

Model działa w architekturze end-to-end o skali dziesiątek miliardów parametrów (百亿级, wg materiałów producenta) i wykorzystuje architekturę World Unified Model oraz tokenizator akcji X-Tokenizer. Na wejściu przyjmuje obraz (RGB-D, czujniki 3D-ToF), dane proprioceptywne robota oraz instrukcje w języku naturalnym, a na wyjściu generuje sekwencje sterowania akcją.

WALL-A obsługuje uczenie few-shot między zadaniami, manipulację obiektami trudnymi (tarcie, płyny, obiekty deformowalne), kontrolę siły i precyzyjne pozycjonowanie, ucieleśnione rozumowanie łańcuchem myśli (embodied chain-of-thought) oraz długie sekwencje operacji z precyzją poniżej milimetra na układach o wielu stopniach swobody.

Model jest wdrażany w robotach X Square Robot, m.in. Quantum X1 Pro (kołowy, dwuramienny), Quantum X2 (kołowy humanoid) oraz w pięciopalczastej dłoni ArtiXon Hand. Jest to rozwiązanie własnościowe (closed), dostępne poprzez produkty firmy, a nie jako oddzielny model do pobrania.

Klasyfikacja
Bazowy model robotycznyModel wzrok-język-akcja
Rodzina: WALL
Dostęp i wdrożenie
Na urządzeniuLokalnie
Wagi: Zamknięte
Kluczowe parametry
🧩 Parametry: 百亿级 (skala dziesiątek miliardów, wg producenta)
📥 Wejście: tekst, obraz, głębia, sensory robota
Robotyka
Robot manipulationDexterous manipulationBimanual manipulationEmbodied task planningRobot controlSpatial reasoningObject affordance understanding

Specyfikacja techniczna

Parametry
百亿级 (skala dziesiątek miliardów, wg producenta)
parametrów
Licencja
Proprietary
Wymagania sprzętowe
Wdrażany na robotach X Square Robot (Quantum X1 Pro, Quantum X2, ArtiXon Hand).
Modalności
⬇ Wejście (Input)
textimagedepthrobot_sensorsrobot_state_data
⬆ Wyjście (Output)
robot_actionsmanipulator_controlrobot_commands

Możliwości i zastosowania

Natywne możliwości modelu
Zaawansowane rozumowanie
Zdolność do wieloetapowego, ustrukturyzowanego rozumowania: analiza problemów, planowanie kroków, wnioskowanie na podstawie hipotez. Modele reasoning-first (np. GPT-5.1 Thinking) dedykują część inferencji na łańcuchy myślowe zanim udzielą odpowiedzi.
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Robotyka
Robot manipulationDexterous manipulationBimanual manipulationEmbodied task planningRobot controlSpatial reasoningObject affordance understanding
Dziedziny zastosowań

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)