Robocikowo>ROBOCIKOWO
Wan2.2-TI2V-5B

Wan2.2-TI2V-5B

Wan2.2-TI2V-5B · Rodzina: Wan
Gęsty model 5B do generowania wideo od Alibaby (Tongyi Wanxiang), łączący text-to-video i image-to-video w 720p/24 fps na jednej konsumenckiej karcie; licencja Apache 2.0.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel generowania wideoModel multimodalny📁 Wan
Data premiery
28 lipca 2025
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Wan2.2-TI2V-5B to model generowania wideo opracowany przez laboratorium Tongyi Wanxiang należące do Alibaby, udostępniony 28 lipca 2025 roku wraz z kodem inferencyjnym i wagami na licencji Apache 2.0. W odróżnieniu od większych wariantów rodziny Wan2.2 (T2V-A14B i I2V-A14B, oba o architekturze MoE z 27 mld parametrów i 14 mld aktywnych) model TI2V-5B jest gęsty i liczy 5 mld parametrów, a jego nazwa odzwierciedla ujednolicenie dwóch zadań: text-to-video oraz image-to-video w jednym modelu.

Sercem modelu jest wysokokompresyjny autoenkoder Wan2.2-VAE o współczynniku kompresji T×H×W równym 4×16×16; dodatkowa warstwa patchyfikacji podnosi łączną kompresję do 4×32×32. Dzięki temu model generuje wideo w rozdzielczości 720p przy 24 klatkach na sekundę (1280×704 lub 704×1280) na sprzęcie konsumenckim — pięciosekundowy klip powstaje w mniej niż 9 minut bez dodatkowych optymalizacji, przy minimum 24 GB VRAM (np. RTX 4090). Uruchomienie wymaga PyTorch w wersji 2.4.0 lub nowszej.

Poza generowaniem treści wideo model znalazł zastosowanie w robotyce: chińska firma PsiBot wykorzystała go jako backbone warstwy dolnej w modelu bazowym Psi-R2.5, gdzie odpowiada za generowanie trajektorii akcji robota na podstawie wyjścia warstwy planującej i bieżącej obserwacji. W materiałach PsiBot model bywa zapisywany jako „Wan2.2-IT2V-5B" — to przestawienie liter w oficjalnej nazwie TI2V.

Klasyfikacja
Model generowania wideoModel multimodalny
Rodzina: Wan
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📥 Wejście: tekst, obraz

Specyfikacja techniczna

Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
video

Możliwości i zastosowania

Natywne możliwości modelu
Generowanie wideo
Zdolność modelu do generowania klipów wideo z opisu tekstowego, obrazu lub innego wideo, z kontrolą długości, rozdzielczości i charakterystyk wizualnych.
Kategoria: video
Generowanie wideo z tekstu (text-to-video)
Generowanie sekwencji wideo na podstawie opisu tekstowego (i opcjonalnie obrazu), z zachowaniem spojnej dynamiki sceny.
Kategoria: video
Animacja obrazu (image-to-video)
Zdolność modelu do animowania statycznego obrazu wejściowego — przedłużania go w czasie do spójnego klipu wideo zgodnie z opisem ruchu lub akcji.
Kategoria: video
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal