Model generacji i edycji obrazu z rodziny Qwen (Alibaba). Lekka architektura Single-Stream DiT (ok. 7B), text-to-image, edycja referencyjna i natywna przezroczystość (RGBA).
Parametry
~7B (komponent generacji wizualnej)
parametrów
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: ~7B (komponent generacji wizualnej)
📥 Wejście: tekst, obraz
Specyfikacja techniczna
Parametry
~7B (komponent generacji wizualnej)
parametrów
Licencja
Qwen Research License
Wymagania sprzętowe
Wymaga GPU z pamięcią wystarczającą dla modelu dyfuzyjnego klasy ~7B; dokładne wymagania zależą od rozdzielczości i trybu (generacja vs edycja).
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
image
Możliwości i zastosowania
Natywne możliwości modelu
Generowanie obrazu z tekstu (text-to-image)
Zdolnosc modelu do tworzenia obrazow na podstawie opisu tekstowego (promptu), w tym kontroli stylu, kompozycji, proporcji i renderowania tekstu na obrazie.
Kategoria: vision
Edycja obrazów
Modyfikacja istniejącego obrazu na podstawie instrukcji tekstowej lub bezpośrednich adnotacji: usuwanie obiektów, zmiana stylu, dodawanie elementów, uzupełnianie fragmentów (inpainting/outpainting), zachowując tożsamość osób i spójność sceny.
Kategoria: vision
Architektura techniczna
Rdzeń architektury (Core Architecture)
