
Model świata warunkowany akcjami od PsiBot: z obrazu, języka i trajektorii akcji robota przewiduje przyszłe wideo; druga połowa dwusystemowej architektury obok Psi-R2.
✓ Aktywny⏳ Ograniczony dostępModel świataBazowy model robotycznyModel generowania wideo
Data premiery
10 kwietnia 2026
Dostęp:HostedWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Klasyfikacja
Model świataBazowy model robotycznyModel generowania wideo
Dostęp i wdrożenie
Hostowane
LokalnieChmura
Wagi: Zamknięte
Kluczowe parametry
📥 Wejście: obraz, tekst, dane stanu robota
Specyfikacja techniczna
Modalności
⬇ Wejście (Input)
imagetextrobot_state_data
⬆ Wyjście (Output)
video
Możliwości i zastosowania
Natywne możliwości modelu
Symulacja świata
Zdolność modelu do generowania spójnych, interaktywnych symulacji środowisk fizycznych — utrzymywanie geometrii, oświetlenia i fizyki podczas eksploracji.
Kategoria: multimodal
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Generowanie wideo
Zdolność modelu do generowania klipów wideo z opisu tekstowego, obrazu lub innego wideo, z kontrolą długości, rozdzielczości i charakterystyk wizualnych.
Kategoria: video
Animacja obrazu (image-to-video)
Zdolność modelu do animowania statycznego obrazu wejściowego — przedłużania go w czasie do spójnego klipu wideo zgodnie z opisem ruchu lub akcji.
Kategoria: video
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Generowanie danych syntetycznych
Generowanie syntetycznych zbiorów danych zachowujących statystyczne właściwości oryginału, używanych do uczenia modeli, testów i ochrony prywatności.
Kategoria: structured_generation
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video