X-
Generalistyczny model wizja-język-akcja (0,9B) oparty na flow-matchingu i „miękko promptowanym" transformerze, sterujący robotami w wielu ucieleśnieniach.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel wzrok-język-akcjaBazowy model robotyczny
Parametry
0.9B
parametrów
Data premiery
11 października 2025
Dostęp:DownloadWdrożenie:💻 Lokalnie
Przegląd
Klasyfikacja
Model wzrok-język-akcjaBazowy model robotyczny
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 0.9B
✓ Fine-tuning
📥 Wejście: obraz, tekst, dane stanu robota
Specyfikacja techniczna
Parametry
0.9B
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Pojedynczy GPU klasy konsumenckiej/serwerowej (model 0,9B, BFloat16); PyTorch + Transformers.
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
imagetextrobot_state_data
⬆ Wyjście (Output)
robot_actionsmotion_trajectories
Możliwości i zastosowania
Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Efektywność próbkowa
Zdolność do osiągania wysokiej wydajności przy znacznie mniejszej liczbie interakcji ze środowiskiem lub przykładów uczących.
Kategoria: other
Wyniki benchmarków
4 benchmarki
LIBERO
symulacja manipulacji
📄 paper
Wynik na poziomie stanu wiedzy (SOTA) wg publikacji X-VLA (2025).
SimplerEnv
📄 paper
Wynik SOTA wg publikacji (WidowX, Google Robot).
CALVIN ABC→D
📄 paper
Wynik SOTA wg publikacji.
RoboTwin 2.0
📄 paper
Wynik SOTA wg publikacji.
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)