Robocikowo>ROBOCIKOWO
HunyuanVideo

HunyuanVideo

HunyuanVideo (13B) · Rodzina: Hunyuan
Otwarty model generowania wideo Tencent (>13 mld parametrów): text-to-video (image-to-video przez HunyuanVideo-I2V), DiT + causal 3D VAE, 540p–720p, 129 klatek.
✓ Aktywny✓ Publiczny dostęp⚖ Open weightsModel generowania wideoModel multimodalny📁 Hunyuan
Parametry
13B+
parametrów
Data premiery
3 grudnia 2024
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

HunyuanVideo to model generowania wideo opracowany przez Tencent, udostępniony 3 grudnia 2024 r. z ponad 13 miliardami parametrów — w momencie premiery największy otwarty (open-source) model generowania wideo. Kod opublikowano na GitHubie, a wagi (wraz z wersjami skwantyzowanymi FP8) na Hugging Face, na licencji Tencent Hunyuan Community License Agreement.

Model opiera się na architekturze transformera dyfuzyjnego (diffusion transformer) z hybrydowym projektem „dual-stream to single-stream”: w fazie dwustrumieniowej tokeny wideo i tekstu przetwarzane są niezależnie, a w fazie jednostrumieniowej łączone w celu multimodalnej fuzji. Za kodowanie tekstu odpowiada multimodalny model językowy (MLLM) o dekoderowej strukturze wraz z dwukierunkowym token refinerem, a kompresję realizuje przyczynowy (causal) 3D VAE o współczynnikach 4 (czas), 8 (przestrzeń) i 16 (kanały).

HunyuanVideo generuje wideo z tekstu (text-to-video), a osobny model HunyuanVideo-I2V dodaje animację z obrazu (image-to-video). Obsługiwane są rozdzielczości od 540p do 720p w różnych proporcjach kadru (9:16, 16:9, 4:3, 3:4, 1:1) oraz nagrania o długości 129 klatek (np. 720×1280, 129 klatek).

Według raportu technicznego HunyuanVideo przewyższa wcześniejsze najlepsze modele, w tym Runway Gen-3, Luma 1.6 oraz trzy czołowe chińskie modele generowania wideo. Model powstał dzięki starannej selekcji danych, zaawansowanemu projektowi architektury oraz progresywnemu skalowaniu treningu; celem Tencenta było zmniejszenie różnicy między społecznością modeli zamkniętych i otwartych.

Klasyfikacja
Model generowania wideoModel multimodalny
Rodzina: Hunyuan
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 13B+
✓ Fine-tuning
📥 Wejście: tekst, obraz

Specyfikacja techniczna

Parametry
13B+
parametrów
Licencja
Tencent Hunyuan Community License Agreement
Wymagania sprzętowe
Model z otwartymi wagami (Hugging Face), z kodem na GitHubie; wymaga GPU o dużej pamięci VRAM do lokalnej inferencji (dostępne też wersje skwantyzowane FP8 zmniejszające zapotrzebowanie). Alternatywnie dostępny przez chmurę Tencent.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
video

Możliwości i zastosowania

Natywne możliwości modelu
Generowanie wideo z tekstu
Zdolność modelu do tworzenia klipów wideo bezpośrednio z opisu tekstowego (prompt), z kontrolą nad ruchem, kompozycją kadru, stylem i długością nagrania.
Kategoria: video
Animacja obrazu (image-to-video)
Zdolność modelu do animowania statycznego obrazu wejściowego — przedłużania go w czasie do spójnego klipu wideo zgodnie z opisem ruchu lub akcji.
Kategoria: video
Generowanie wideo
Zdolność modelu do generowania klipów wideo z opisu tekstowego, obrazu lub innego wideo, z kontrolą długości, rozdzielczości i charakterystyk wizualnych.
Kategoria: video

Architektura techniczna

Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)