Robocikowo>ROBOCIKOWO
Octo

Octo

1.5
Otwarty, transformerowy model polityki robotycznej (generalist robot policy) z dyfuzyjną głowicą akcji, wytrenowany na 800 tys. trajektorii z Open X-Embodiment; sterowany językiem lub obrazem celu.
🔬 Research✓ Publiczny dostęp⚖ Open sourceBazowy model robotycznyModel wzrok-język-akcja
Parametry
27M / 93M
parametrów
Data premiery
20 maja 2024
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Octo to otwarty, uogólniony model polityki robotycznej (generalist robot policy) opracowany przez zespół Octo Model Team skupiający badaczy z UC Berkeley, Uniwersytetu Stanforda, Carnegie Mellon University oraz Google DeepMind. Model oparty jest na architekturze transformera z dyfuzyjną głowicą akcji (diffusion policy), dzięki czemu potrafi modelować wielomodalne rozkłady akcji manipulatora.

Octo został wstępnie wytrenowany na 800 tys. trajektorii pochodzących z 25 zbiorów danych wchodzących w skład Open X-Embodiment — największego jak dotąd zbioru danych do manipulacji robotycznej. Model można sterować poleceniami w języku naturalnym lub obrazami celu, a jego modularna struktura uwagi umożliwia szybkie dostrajanie (fine-tuning) do nowych robotów, czujników i przestrzeni akcji w ciągu kilku godzin na standardowych, konsumenckich GPU.

Dostępne są dwa warianty: Octo-Small (27 mln parametrów) oraz Octo-Base (93 mln parametrów). Kod źródłowy udostępniono na licencji MIT (framework JAX), a wagi opublikowano na Hugging Face (rail-berkeley). W eksperymentach na 9 platformach robotycznych Octo sprawdza się jako uniwersalna inicjalizacja polityki, którą można skutecznie dostroić do nowych obserwacji i przestrzeni akcji.

Klasyfikacja
Bazowy model robotycznyModel wzrok-język-akcja
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 27M / 93M
✓ Fine-tuning
📥 Wejście: tekst, obraz, dane stanu robota, sensory robota
Robotyka
Robot controlRobot manipulationMotion planningDexterous manipulation

Specyfikacja techniczna

Parametry
27M / 93M
parametrów
Licencja
MIT
Wymagania sprzętowe
Dostrajanie (fine-tuning) w kilka godzin na pojedynczym konsumenckim GPU; inferencja ok. 13–17 iteracji/s (Octo-Base / Octo-Small). Framework JAX.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
textimagerobot_state_datarobot_sensors
⬆ Wyjście (Output)
robot_actionsmotion_trajectoriesmanipulator_control

Możliwości i zastosowania

Natywne możliwości modelu
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Robotyka
Robot controlRobot manipulationMotion planningDexterous manipulation

Wyniki benchmarków

2 benchmarki
Open X-Embodiment / WidowX (BridgeData) — zero-shot
success rate · zero-shot
0.50
📄 paper
Wynik zero-shot na robocie WidowX raportowany w pracy Octo.
Fine-tuning (średnia z 6 zadań)
success rate · finetuned
0.72
📄 paper
Średni wskaźnik sukcesu po dostrojeniu; +52% względem bazliny VC-1.

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)