Otwarty model generowania wideo Tencent (>13 mld parametrów): text-to-video (image-to-video przez HunyuanVideo-I2V), DiT + causal 3D VAE, 540p–720p, 129 klatek.
Parametry
13B+
parametrów
Data premiery
3 grudnia 2024
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 13B+
✓ Fine-tuning
📥 Wejście: tekst, obraz
Specyfikacja techniczna
Parametry
13B+
parametrów
Licencja
Tencent Hunyuan Community License Agreement
Wymagania sprzętowe
Model z otwartymi wagami (Hugging Face), z kodem na GitHubie; wymaga GPU o dużej pamięci VRAM do lokalnej inferencji (dostępne też wersje skwantyzowane FP8 zmniejszające zapotrzebowanie). Alternatywnie dostępny przez chmurę Tencent.
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
video
Możliwości i zastosowania
Natywne możliwości modelu
Generowanie wideo z tekstu
Zdolność modelu do tworzenia klipów wideo bezpośrednio z opisu tekstowego (prompt), z kontrolą nad ruchem, kompozycją kadru, stylem i długością nagrania.
Kategoria: video
Animacja obrazu (image-to-video)
Zdolność modelu do animowania statycznego obrazu wejściowego — przedłużania go w czasie do spójnego klipu wideo zgodnie z opisem ruchu lub akcji.
Kategoria: video
Generowanie wideo
Zdolność modelu do generowania klipów wideo z opisu tekstowego, obrazu lub innego wideo, z kontrolą długości, rozdzielczości i charakterystyk wizualnych.
Kategoria: video
Dziedziny zastosowań
Architektura techniczna
Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)
