
Otwarty, transformerowy model polityki robotycznej (generalist robot policy) z dyfuzyjną głowicą akcji, wytrenowany na 800 tys. trajektorii z Open X-Embodiment; sterowany językiem lub obrazem celu.
🔬 Research✓ Publiczny dostęp⚖ Open sourceBazowy model robotycznyModel wzrok-język-akcja
Parametry
27M / 93M
parametrów
Data premiery
20 maja 2024
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Klasyfikacja
Bazowy model robotycznyModel wzrok-język-akcja
Zastosowania
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 27M / 93M
✓ Fine-tuning
📥 Wejście: tekst, obraz, dane stanu robota, sensory robota
Robotyka
Robot controlRobot manipulationMotion planningDexterous manipulation
Specyfikacja techniczna
Parametry
27M / 93M
parametrów
Licencja
MIT
Wymagania sprzętowe
Dostrajanie (fine-tuning) w kilka godzin na pojedynczym konsumenckim GPU; inferencja ok. 13–17 iteracji/s (Octo-Base / Octo-Small). Framework JAX.
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
textimagerobot_state_datarobot_sensors
⬆ Wyjście (Output)
robot_actionsmotion_trajectoriesmanipulator_control
Możliwości i zastosowania
Natywne możliwości modelu
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Robotyka
Robot controlRobot manipulationMotion planningDexterous manipulation
Dziedziny zastosowań
Wyniki benchmarków
2 benchmarki
Open X-Embodiment / WidowX (BridgeData) — zero-shot
success rate · zero-shot
0.50
📄 paper
Wynik zero-shot na robocie WidowX raportowany w pracy Octo.
Fine-tuning (średnia z 6 zadań)
success rate · finetuned
0.72
📄 paper
Średni wskaźnik sukcesu po dostrojeniu; +52% względem bazliny VC-1.
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)