Robocikowo>ROBOCIKOWO
WALL-OSS-0.5

WALL-OSS-0.5

WALL-OSS-0.5 · Rodzina: WALL
Otwarty (Apache-2.0) model wizualno-językowo-akcyjny X Square Robot (~4B, backbone VLM 3B). Gotowy do wdrożenia bez dostrajania; flow matching, 20+ ucieleśnień.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceBazowy model robotycznyModel wzrok-język-akcja📁 WALL
Parametry
4B (backbone VLM 3B)
parametrów
Data premiery
28 maja 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie📱 Na urządzeniu

Przegląd

WALL-OSS-0.5 to otwarty (open-source) model wizualno-językowo-akcyjny (VLA) opracowany przez X Square Robot (自变量机器人, Shenzhen) i udostępniony 28 maja 2026 r. Należy do serii modeli bazowych WALL i jest rozwinięciem wcześniejszego WALL-OSS. Hasło modelu brzmi „Pretrain Once, Act Anywhere” — model jest gotowy do wdrożenia bezpośrednio z wytrenowanego checkpointu, bez dostrajania pod konkretne zadanie.

Model liczy około 4 mld parametrów i jest zbudowany na bazie modelu wizualno-językowego (VLM) o skali 3 mld parametrów, uzupełnionego o komponenty generowania akcji. W treningu dyskretne tokeny akcji kształtują backbone VLM, na etapie inferencji akcje ciągłe dostarcza mechanizm flow matching, a ugruntowane dane multimodalne zachowują priory wizualno-językowe (co-training z „mostkowaniem gradientów”).

WALL-OSS-0.5 wytrenowano na danych z ponad 20 typów robotów, milionach trajektorii oraz korpusie multimodalnym liczącym ok. 90 mln pozycji. Na wejściu przyjmuje obraz, dane sensoryczne i stan robota oraz instrukcje w języku naturalnym, a na wyjściu generuje ciągłe akcje sterujące. Model osiąga nietrywialne wyniki zero-shot na zestawie 17 zadań oraz średni postęp zadania 60,5% na 15 zadaniach na realnych robotach (po dostrajaniu).

Model jest udostępniony na licencji Apache-2.0 wraz z wagami, kodem i narzędziami (GitHub, Hugging Face). Pozwala to na komercyjne i niekomercyjne użycie, samodzielne uruchamianie oraz dostrajanie na różnych ucieleśnieniach robotów.

Klasyfikacja
Bazowy model robotycznyModel wzrok-język-akcja
Rodzina: WALL
Dostęp i wdrożenie
Pobieranie
LokalnieNa urządzeniu
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 4B (backbone VLM 3B)
✓ Fine-tuning
📥 Wejście: tekst, obraz, sensory robota, dane stanu robota
Robotyka
Robot manipulationDexterous manipulationEmbodied task planningRobot controlVisual groundingObject affordance understandingSpatial reasoning

Specyfikacja techniczna

Parametry
4B (backbone VLM 3B)
parametrów
Licencja
Apache-2.0
Wymagania sprzętowe
Wytrenowany na 20+ typach robotów; wdrażany lokalnie/on-device na robotach. Wymaga akceleracji GPU.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
textimagerobot_sensorsrobot_state_data
⬆ Wyjście (Output)
robot_actionsmanipulator_controlmotion_trajectories

Możliwości i zastosowania

Natywne możliwości modelu
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Zaawansowane rozumowanie
Zdolność do wieloetapowego, ustrukturyzowanego rozumowania: analiza problemów, planowanie kroków, wnioskowanie na podstawie hipotez. Modele reasoning-first (np. GPT-5.1 Thinking) dedykują część inferencji na łańcuchy myślowe zanim udzielą odpowiedzi.
Kategoria: reasoning
Robotyka
Robot manipulationDexterous manipulationEmbodied task planningRobot controlVisual groundingObject affordance understandingSpatial reasoning

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)

Wdrożenie i bezpieczeństwo

☁ Dostępny na platformach