Robocikowo>ROBOCIKOWO
X-

X-VLA

0.9B (X-VLA-Pt)
Generalistyczny model wizja-język-akcja (0,9B) oparty na flow-matchingu i „miękko promptowanym" transformerze, sterujący robotami w wielu ucieleśnieniach.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel wzrok-język-akcjaBazowy model robotyczny
Parametry
0.9B
parametrów
Data premiery
11 października 2025
Dostęp:DownloadWdrożenie:💻 Lokalnie

Przegląd

X-VLA to generalistyczny model wizja-język-akcja (VLA) do sterowania robotami na różnych platformach sprzętowych. Architektura opiera się wyłącznie na standardowym, „miękko promptowanym" transformerze z denoiserem akcji uczonym metodą flow matching. Model liczy 0,9 mld parametrów i działa w precyzji BFloat16.

Kluczową innowacją są osobne zestawy uczonych osadzeń (soft prompts) dla każdego odrębnego ucieleśnienia, co pozwala skutecznie wykorzystywać cechy międzyucieleśnieniowe przy zachowaniu skalowalności. Na model składają się: enkoder wizyjno-językowy Florence-2, SoftPromptedTransformer (denoiser akcji oparty na flow matching) oraz „Action Hub" zarządzający przestrzeniami akcji, maskowaniem i przetwarzaniem wstępnym.

X-VLA trenowano na heterogenicznych zbiorach danych (m.in. Bridge Data) i oceniano w sześciu środowiskach symulacyjnych oraz na trzech rzeczywistych robotach, osiągając wyniki na poziomie stanu wiedzy (SOTA) na benchmarkach LIBERO, SimplerEnv, CALVIN i RoboTwin 2.0. Wagi udostępniono na licencji Apache 2.0.

Klasyfikacja
Model wzrok-język-akcjaBazowy model robotyczny
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 0.9B
✓ Fine-tuning
📥 Wejście: obraz, tekst, dane stanu robota

Specyfikacja techniczna

Parametry
0.9B
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Pojedynczy GPU klasy konsumenckiej/serwerowej (model 0,9B, BFloat16); PyTorch + Transformers.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
imagetextrobot_state_data
⬆ Wyjście (Output)
robot_actionsmotion_trajectories

Możliwości i zastosowania

Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Efektywność próbkowa
Zdolność do osiągania wysokiej wydajności przy znacznie mniejszej liczbie interakcji ze środowiskiem lub przykładów uczących.
Kategoria: other

Wyniki benchmarków

4 benchmarki
LIBERO
symulacja manipulacji
📄 paper
Wynik na poziomie stanu wiedzy (SOTA) wg publikacji X-VLA (2025).
SimplerEnv
📄 paper
Wynik SOTA wg publikacji (WidowX, Google Robot).
CALVIN ABC→D
📄 paper
Wynik SOTA wg publikacji.
RoboTwin 2.0
📄 paper
Wynik SOTA wg publikacji.

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)