Otwarty (Apache-2.0) model wizualno-językowo-akcyjny X Square Robot (~4B, backbone VLM 3B). Gotowy do wdrożenia bez dostrajania; flow matching, 20+ ucieleśnień.
Parametry
4B (backbone VLM 3B)
parametrów
Data premiery
28 maja 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie📱 Na urządzeniu
Przegląd
Zastosowania
Dostęp i wdrożenie
Pobieranie
LokalnieNa urządzeniu
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 4B (backbone VLM 3B)
✓ Fine-tuning
📥 Wejście: tekst, obraz, sensory robota, dane stanu robota
Robotyka
Robot manipulationDexterous manipulationEmbodied task planningRobot controlVisual groundingObject affordance understandingSpatial reasoning
Platformy
Specyfikacja techniczna
Parametry
4B (backbone VLM 3B)
parametrów
Licencja
Apache-2.0
Wymagania sprzętowe
Wytrenowany na 20+ typach robotów; wdrażany lokalnie/on-device na robotach. Wymaga akceleracji GPU.
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
textimagerobot_sensorsrobot_state_data
⬆ Wyjście (Output)
robot_actionsmanipulator_controlmotion_trajectories
Możliwości i zastosowania
Natywne możliwości modelu
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Zaawansowane rozumowanie
Zdolność do wieloetapowego, ustrukturyzowanego rozumowania: analiza problemów, planowanie kroków, wnioskowanie na podstawie hipotez. Modele reasoning-first (np. GPT-5.1 Thinking) dedykują część inferencji na łańcuchy myślowe zanim udzielą odpowiedzi.
Kategoria: reasoning
Robotyka
Robot manipulationDexterous manipulationEmbodied task planningRobot controlVisual groundingObject affordance understandingSpatial reasoning
Dziedziny zastosowań
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)
Wdrożenie i bezpieczeństwo
☁ Dostępny na platformach
