
Otwarty foundation model Perceptron AI do uczenia robotów: łączy rozumienie wideo, ucieleśnione rozumowanie i sterowanie robotem w rzadkim modelu 36B (MoE).
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceBazowy model robotycznyModel wzrok-język-akcjaModel multimodalny
Parametry
36B (sparse MoE)
parametrów
Data premiery
26 sierpnia 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie📱 Na urządzeniu
Przegląd
Klasyfikacja
Bazowy model robotycznyModel wzrok-język-akcjaModel multimodalny
Zastosowania
Dostęp i wdrożenie
Pobieranie
LokalnieNa urządzeniu
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 36B (sparse MoE)
✓ Fine-tuning
📥 Wejście: tekst, obraz, wideo, dane stanu robota
Robotyka
Robot controlRobot manipulationVisual groundingSpatial reasoningSpatial predictionEmbodied task planningScene understandingEnvironment modeling
Specyfikacja techniczna
Parametry
36B (sparse MoE)
parametrów
Licencja
Apache 2.0
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
textimagevideorobot_state_data
⬆ Wyjście (Output)
textstructured_datarobot_actionsmotion_trajectories
Możliwości i zastosowania
Natywne możliwości modelu
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Sledzenie obiektow (wideo)
Zdolnosc do sledzenia wybranych obiektow w kolejnych klatkach wideo, w tym utrzymywania ich masek/tozsamosci mimo ruchu, przeslon i zmian wygladu.
Kategoria: vision
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Robotyka
Robot controlRobot manipulationVisual groundingSpatial reasoningSpatial predictionEmbodied task planningScene understandingEnvironment modeling
Dziedziny zastosowań
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)