
Model bazowy embodied AI od PsiBot: dwuwarstwowa architektura (QwenVL3.5-4B + Wan2.2-IT2V-5B) przebudowana wokół silnych danych sparowanych (strong pair data) człowiek–robot.
✓ Aktywny⏳ Ograniczony dostępModel wzrok-język-akcjaBazowy model robotycznyModel multimodalny
Dostęp:HostedWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Klasyfikacja
Model wzrok-język-akcjaBazowy model robotycznyModel multimodalny
Dostęp i wdrożenie
Hostowane
LokalnieChmura
Wagi: Zamknięte
Kluczowe parametry
📥 Wejście: tekst, obraz, wideo, sensory robota…
Specyfikacja techniczna
Modalności
⬇ Wejście (Input)
textimagevideorobot_sensorsrobot_state_data
⬆ Wyjście (Output)
robot_actionsmotion_trajectoriesmanipulator_controltext
Możliwości i zastosowania
Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other
Uczenie few-shot
Zdolność modelu do wykonania nowego zadania na podstawie kilku przykładów podanych bezpośrednio w prompcie, bez aktualizacji wag ani dostrajania.
Kategoria: other
Efektywność próbkowa
Zdolność do osiągania wysokiej wydajności przy znacznie mniejszej liczbie interakcji ze środowiskiem lub przykładów uczących.
Kategoria: other
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision