Robocikowo>ROBOCIKOWO
Psi-W0

Psi-W0

Psi-W0
Model świata warunkowany akcjami od PsiBot: z obrazu, języka i trajektorii akcji robota przewiduje przyszłe wideo; druga połowa dwusystemowej architektury obok Psi-R2.
✓ Aktywny⏳ Ograniczony dostępModel świataBazowy model robotycznyModel generowania wideo
Data premiery
10 kwietnia 2026
Dostęp:HostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Psi-W0 to model świata warunkowany akcjami (action-conditioned world model) opracowany przez chińską firmę PsiBot (灵初智能). Formalnie udostępniono go 10 kwietnia 2026 roku razem z modelem Psi-R2 — przy tej samej okazji firma otworzyła pierwsze 1000 godzin danych operacji ludzkich dłoni.

Na wejściu model przyjmuje obraz, język oraz trajektorię akcji robota, a na wyjściu generuje przewidywane wideo przyszłości. W architekturze dwusystemowej PsiBot Psi-W0 pełni rolę komplementarną wobec modelu polityki operacyjnej Psi-R2: służy do oceny i podnoszenia jakości polityki oraz domyka „koło zamachowe danych" (data flywheel) razem z Psi-R2.

W kolejnej generacji modelu Psi-R2.5 Psi-W0 dostał dodatkowe zastosowanie: jest używany do odwrotnego generowania danych ręki ludzkiej z trajektorii robota, co pozwala tworzyć silne dane sparowane (strong pair data) bez ręcznego zbierania zsynchronizowanych nagrań człowieka.

Klasyfikacja
Model świataBazowy model robotycznyModel generowania wideo
Dostęp i wdrożenie
Hostowane
LokalnieChmura
Wagi: Zamknięte
Kluczowe parametry
📥 Wejście: obraz, tekst, dane stanu robota

Specyfikacja techniczna

Modalności
⬇ Wejście (Input)
imagetextrobot_state_data
⬆ Wyjście (Output)
video

Możliwości i zastosowania

Natywne możliwości modelu
Symulacja świata
Zdolność modelu do generowania spójnych, interaktywnych symulacji środowisk fizycznych — utrzymywanie geometrii, oświetlenia i fizyki podczas eksploracji.
Kategoria: multimodal
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Generowanie wideo
Zdolność modelu do generowania klipów wideo z opisu tekstowego, obrazu lub innego wideo, z kontrolą długości, rozdzielczości i charakterystyk wizualnych.
Kategoria: video
Animacja obrazu (image-to-video)
Zdolność modelu do animowania statycznego obrazu wejściowego — przedłużania go w czasie do spójnego klipu wideo zgodnie z opisem ruchu lub akcji.
Kategoria: video
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Generowanie danych syntetycznych
Generowanie syntetycznych zbiorów danych zachowujących statystyczne właściwości oryginału, używanych do uczenia modeli, testów i ochrony prywatności.
Kategoria: structured_generation
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video