Robocikowo>ROBOCIKOWO
Psi-R2.5

Psi-R2.5

Psi-R2.5
Model bazowy embodied AI od PsiBot: dwuwarstwowa architektura (QwenVL3.5-4B + Wan2.2-IT2V-5B) przebudowana wokół silnych danych sparowanych (strong pair data) człowiek–robot.
✓ Aktywny⏳ Ograniczony dostępModel wzrok-język-akcjaBazowy model robotycznyModel multimodalny
Dostęp:HostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Psi-R2.5 to model bazowy inteligencji ucieleśnionej (embodied AI) opracowany przez chińską firmę PsiBot (灵初智能), zaprezentowany we wrześniu 2026 roku jako rozwinięcie modelu Psi-R2. Zamiast dalej skalować wolumen danych, zespół przebudował cały łańcuch treningowy wokół jakości danych — kluczowym pojęciem jest tu „strong pair data", czyli pary demonstracji człowiek–robot zsynchronizowane klatka po klatce.

Architektura jest dwuwarstwowa. Warstwa górna, oparta na backbonie QwenVL3.5-4B, przetwarza instrukcje wizualno-językowe i rozkłada je na podzadania, korzystając z kontekstu metadanych (pamięć, miękkie prompty) oraz sygnałów wartości z uczenia ze wzmocnieniem. Warstwa dolna, oparta na backbonie Wan2.2-IT2V-5B, generuje trajektorie akcji robota na podstawie wyjścia warstwy górnej i bieżącej obserwacji.

Nietypowy jest kierunek generowania danych: zamiast przekładać nagrania człowieka na dane robota, PsiBot używa modelu świata Psi-W0 do odwrotnego wygenerowania danych ręki ludzkiej z trajektorii robota, a następnie trenuje transformer w stylu edycji wideo (nie politykę), który mapuje wejście z ręką człowieka na dopasowane wyjście robota. Poprawność weryfikuje się bezpośrednim odtworzeniem na robocie oraz skutecznością dostrajania zadań końcowych. Psi-R2.5 wykazuje generalizację zero-shot przez uczenie w kontekście — pojedyncza demonstracja człowieka, przełożona na format robota, wystarcza do adaptacji zadania bez aktualizacji wag.

Klasyfikacja
Model wzrok-język-akcjaBazowy model robotycznyModel multimodalny
Dostęp i wdrożenie
Hostowane
LokalnieChmura
Wagi: Zamknięte
Kluczowe parametry
📥 Wejście: tekst, obraz, wideo, sensory robota

Specyfikacja techniczna

Modalności
⬇ Wejście (Input)
textimagevideorobot_sensorsrobot_state_data
⬆ Wyjście (Output)
robot_actionsmotion_trajectoriesmanipulator_controltext

Możliwości i zastosowania

Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other
Uczenie few-shot
Zdolność modelu do wykonania nowego zadania na podstawie kilku przykładów podanych bezpośrednio w prompcie, bez aktualizacji wag ani dostrajania.
Kategoria: other
Efektywność próbkowa
Zdolność do osiągania wysokiej wydajności przy znacznie mniejszej liczbie interakcji ze środowiskiem lub przykładów uczących.
Kategoria: other
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision