Otwarty (Apache-2.0) model generacji obrazu ~20B klasy MMDiT od zespołu Qwen (Alibaba); wyróżnia się renderowaniem tekstu, w tym chińskiego, oraz edycją obrazów.
Parametry
20B (MMDiT)
parametrów
Data premiery
4 sierpnia 2025
Dostęp:DownloadHostedWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Dostęp i wdrożenie
PobieranieHostowane
LokalnieChmura
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 20B (MMDiT)
📥 Wejście: tekst, obraz
Specyfikacja techniczna
Parametry
20B (MMDiT)
parametrów
Licencja
Apache-2.0
Wymagania sprzętowe
Model dyfuzyjny klasy ~20B — lokalne uruchomienie wymaga GPU z dużą ilością VRAM; dokładne wymagania zależą od rozdzielczości, precyzji (BF16) i trybu (generacja vs edycja).
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
image
Możliwości i zastosowania
Natywne możliwości modelu
Generowanie obrazu z tekstu (text-to-image)
Zdolnosc modelu do tworzenia obrazow na podstawie opisu tekstowego (promptu), w tym kontroli stylu, kompozycji, proporcji i renderowania tekstu na obrazie.
Kategoria: vision
Edycja obrazów
Modyfikacja istniejącego obrazu na podstawie instrukcji tekstowej lub bezpośrednich adnotacji: usuwanie obiektów, zmiana stylu, dodawanie elementów, uzupełnianie fragmentów (inpainting/outpainting), zachowując tożsamość osób i spójność sceny.
Kategoria: vision
Architektura techniczna
Rdzeń architektury (Core Architecture)
