Robocikowo>ROBOCIKOWO
Wan2.2

Wan2.2

Wan2.2 · Rodzina: Wan
Otwarty model generowania wideo Alibaba (2025): pierwszy open-source z architekturą MoE (27B/14B). T2V i I2V, 720P@24fps, wariant 5B na RTX 4090. Apache 2.0.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel generowania wideoModel multimodalny📁 Wan
Parametry
27B (14B aktywnych, MoE); wariant TI2V-5B
parametrów
Data premiery
28 lipca 2025
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Wan2.2 to otwarty model generowania wideo opracowany przez zespół Wan w Alibabie, udostępniony 28 lipca 2025 r. Według producenta jest to pierwszy otwartoźródłowy model generowania wideo wykorzystujący architekturę mieszaniny ekspertów (MoE).

Model MoE łączy dwóch wyspecjalizowanych ekspertów: „wysokoszumowego” do wczesnych etapów odszumiania (układ sceny) i „niskoszumowego” do późniejszego dopracowania detali. Łącznie liczy 27 mld parametrów, z czego 14 mld jest aktywnych na krok. Wykorzystuje też autorski enkoder Wan2.2-VAE o wysokim stopniu kompresji.

Wan2.2 obejmuje warianty: T2V-A14B (tekst-na-wideo, 480P/720P), I2V-A14B (obraz-na-wideo), TI2V-5B (zunifikowany tekst/obraz-na-wideo, 720P@24 fps), a także późniejsze S2V-14B (mowa-na-wideo) i Animate-14B (animacja postaci). Wariant TI2V-5B generuje 5-sekundowe wideo 720P w czasie poniżej 9 minut na pojedynczym konsumenckim GPU (np. RTX 4090).

Model udostępniono na licencji Apache 2.0 (kod i wagi na GitHub i Hugging Face), co pozwala na komercyjne i niekomercyjne użycie, samodzielne uruchamianie oraz dostrajanie. Wan2.2 należy do rodziny modeli wideo Wan (Tongyi Wanxiang) firmy Alibaba.

Klasyfikacja
Model generowania wideoModel multimodalny
Rodzina: Wan
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 27B (14B aktywnych, MoE); wariant TI2V-5B
✓ Fine-tuning
📥 Wejście: tekst, obraz

Specyfikacja techniczna

Parametry
27B (14B aktywnych, MoE); wariant TI2V-5B
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Wariant TI2V-5B generuje 5-sek. wideo 720P w <9 min na pojedynczym GPU konsumenckim (np. RTX 4090); warianty A14B wymagają mocniejszego sprzętu.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
video

Możliwości i zastosowania

Natywne możliwości modelu
Generowanie wideo
Zdolność modelu do generowania klipów wideo z opisu tekstowego, obrazu lub innego wideo, z kontrolą długości, rozdzielczości i charakterystyk wizualnych.
Kategoria: video
Animacja obrazu (image-to-video)
Zdolność modelu do animowania statycznego obrazu wejściowego — przedłużania go w czasie do spójnego klipu wideo zgodnie z opisem ruchu lub akcji.
Kategoria: video

Architektura techniczna

Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)

Wdrożenie i bezpieczeństwo

☁ Dostępny na platformach