Enkoder przetwarza fragment akcji wraz z kontekstem multimodalnym (wideo z trzech widoków, język zadania, instrukcje szczegółowe) i dopasowuje reprezentację do zamrożonej przestrzeni cech VLM metodą kontrastywną. Rdzeń SRQ (Semantic Residual Quantization) stosuje asymetryczną resztową kwantyzację wektorową: poziom q0 uczy się zgrubnego zamiaru akcji (np. „chwyć”, „zbliż się”, „odłóż”) przez Masked Action Modeling, a poziomy q1–q3 kodują detale ruchu, pozy końcówki i drobne korekty trajektorii. Dekoder rekonstruuje ciągłe fragmenty akcji z tokenów; dodatkowe funkcje straty (dopasowanie do cech VLM oraz predykcja cech VL następnej klatki) uczą model konsekwencji akcji. Codebook liczy 2048 kodów × 4 kwantyzatory, ze współczynnikiem kompresji 4 i długością fragmentu 8–64.
Modele wizualno-językowo-akcyjne potrzebują reprezentacji akcji, która jest jednocześnie dyskretna (do treningu z entropią krzyżową) i wystarczająco bogata, by zachować precyzyjne sterowanie. Naiwna tokenizacja gubi semantykę albo szczegóły ruchu. X-Tokenizer dostarcza tokeny pełniące podwójną rolę: silny sygnał semantyczny dla backbone’u VLA oraz zachowanie ciągłych detali sterowania, poprawiając dopasowanie multimodalne (+13,5%) i zadania długohoryzontowe (+8,25%).
Koduje fragment akcji z kontekstem multimodalnym i dopasowuje go kontrastywnie do zamrożonej przestrzeni cech VLM.
Asymetryczna resztowa kwantyzacja wektorowa: q0 = zgrubny zamiar akcji (Masked Action Modeling), q1–q3 = detale ruchu i korekty trajektorii.
Rekonstruuje ciągłe fragmenty akcji z tokenów; uczy się dodatkowo dopasowania do cech VLM i predykcji cech VL następnej klatki.
Słownik kodów tokenów: 2048 kodów × 4 kwantyzatory, współczynnik kompresji 4.
Wyniki (RoboTwin, cross-embodiment, realny robot) są ewaluowane przez autorów i nie zostały niezależnie zreplikowane.
Semantyka tokenów zależy od cech zamrożonego modelu wizualno-językowego — słaby VLM ogranicza jakość interfejsu.
Materiały podają 17 lub 18 ucieleśnień robotów (rozbieżność między pracą a kartą modelu).
Praca „X-Tokenizer: A Multimodal Action Tokenizer for Vision-Language-Action Pretraining” (arXiv:2606.14752); trening na 2,4 mln trajektorii (2,0 mld klatek akcji).
Ogłoszenie (2 lipca 2026) jako komponent ekosystemu modelu bazowego WALL-A X Square Robot.
Kontrastywne dopasowanie do dużego, zamrożonego modelu VLM oraz wielopoziomowa resztowa kwantyzacja stanowią najbardziej wymagające obliczeniowo etapy treningu tokenizatora.
Liczba kodów w słowniku tokenów.
Liczba poziomów resztowej kwantyzacji (q0–q3).
Stopień kompresji fragmentu akcji do tokenów.
Liczba kroków akcji w jednym fragmencie.
26-wymiarowa płaska przestrzeń akcji (oburęczne EEF + podwozie + podnośnik + głowa).
Lekki enkoder–dekoder wykonuje gęste obliczenia; kwantyzacja wybiera kody z codebooka (top-k na poziom).
Kodowanie i kwantyzacja fragmentów akcji są równoległe na GPU, ale poziomy resztowe SRQ zależą kolejno od siebie (q0→q1→…).
Trening na 2,4 mln trajektorii i dopasowanie do dużego VLM wymaga akceleracji GPU.