Robocikowo>ROBOCIKOWO
Isaac 0.5

Isaac 0.5

0.5
Otwarty foundation model Perceptron AI do uczenia robotów: łączy rozumienie wideo, ucieleśnione rozumowanie i sterowanie robotem w rzadkim modelu 36B (MoE).
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceBazowy model robotycznyModel wzrok-język-akcjaModel multimodalny
Parametry
36B (sparse MoE)
parametrów
Data premiery
26 sierpnia 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie📱 Na urządzeniu

Przegląd

Isaac 0.5 to otwarty foundation model do uczenia robotów opracowany przez Perceptron AI (Perceptron, Inc.). W jednym rzadkim modelu o 36 miliardach parametrów łączy multimodalne rozumienie wideo, ucieleśnione rozumowanie, ugruntowanie przestrzenne, estymację postępu zadania oraz sterowanie robotem. Model przyjmuje obrazy, wideo, instrukcje w języku naturalnym, stan robota i poprzednie akcje, a zwraca tekst, znormalizowane współrzędne, wyjścia stanu zadania lub akcje robota.

Architektura

Isaac 0.5 wykorzystuje szkielet wizualno-językowy z rodziny Qwen z rzadkimi ekspertami (mixture-of-experts). Każda warstwa MoE daje tokenowi dostęp do 256 wyuczonych ekspertów oraz trasy zerowej — token może użyć od zera do ośmiu trasowanych ekspertów, przy stale aktywnym ekspercie współdzielonym i ścieżce rezydualnej. Sterowanie ciągłe realizuje dedykowany ekspert Flow oraz 36-blokowy transformer dyfuzyjny generujący fragment akcji (action chunk); sterowanie dyskretne korzysta ze słownika 2048 tokenów akcji FAST.

Trening

Model wytrenowano na ponad 35 systemach robotycznych, 100 000 godzin doświadczenia robotów, milionie godzin ogólnego wideo i trzech bilionach tokenów multimodalnych. Rozumienie wideo, ugruntowanie przestrzenne, postęp zadania, predykcja przyszłych percepcji i akcje robota są współtrenowane od początku na jednym wspólnym szkielecie. Perceptron opisuje też prawo skalowania opisujące wymianę między ilością ogólnego wideo a kosztowną teleoperacją.

Dostępność

Wagi modelu publikowane są na Hugging Face na licencji Apache 2.0, a kod treningu i inferencji, integracja z LeRobot, referencyjny serwer polityki oraz narzędzia ewaluacyjne — w repozytorium Perceptron Isaac na GitHub. Checkpoint działa przez repozytorium Perceptron Isaac; bezpośrednie użycie stockowego Transformers czy LeRobot nie jest obecnie wspierane.

Klasyfikacja
Bazowy model robotycznyModel wzrok-język-akcjaModel multimodalny
Dostęp i wdrożenie
Pobieranie
LokalnieNa urządzeniu
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 36B (sparse MoE)
✓ Fine-tuning
📥 Wejście: tekst, obraz, wideo, dane stanu robota
Robotyka
Robot controlRobot manipulationVisual groundingSpatial reasoningSpatial predictionEmbodied task planningScene understandingEnvironment modeling

Specyfikacja techniczna

Parametry
36B (sparse MoE)
parametrów
Licencja
Apache 2.0
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
textimagevideorobot_state_data
⬆ Wyjście (Output)
textstructured_datarobot_actionsmotion_trajectories

Możliwości i zastosowania

Natywne możliwości modelu
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Sledzenie obiektow (wideo)
Zdolnosc do sledzenia wybranych obiektow w kolejnych klatkach wideo, w tym utrzymywania ich masek/tozsamosci mimo ruchu, przeslon i zmian wygladu.
Kategoria: vision
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Robotyka
Robot controlRobot manipulationVisual groundingSpatial reasoningSpatial predictionEmbodied task planningScene understandingEnvironment modeling