Robocikowo>ROBOCIKOWO
Qwen-Image

Qwen-Image

Qwen-Image (base) · Rodzina: Qwen
Otwarty (Apache-2.0) model generacji obrazu ~20B klasy MMDiT od zespołu Qwen (Alibaba); wyróżnia się renderowaniem tekstu, w tym chińskiego, oraz edycją obrazów.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel generowania obrazówModel multimodalny📁 Qwen
Parametry
20B (MMDiT)
parametrów
Data premiery
4 sierpnia 2025
Dostęp:DownloadHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Qwen-Image to bazowy model generacji obrazu (text-to-image) opracowany przez zespół Qwen należący do Alibaba (Tongyi Lab) i udostępniony 4 sierpnia 2025 roku. Jest to model fundamentowy klasy MMDiT (Multimodal Diffusion Transformer) o rozmiarze 20 miliardów parametrów, opublikowany na licencji Apache-2.0 wraz z wagami i kodem.

Model wyróżnia się renderowaniem złożonego tekstu na obrazie — w tym układów wielowierszowych i semantyki na poziomie akapitu — zarówno dla języków alfabetycznych (np. angielski), jak i logograficznych (np. chiński). Oprócz generacji obraz-z-tekstu obsługuje spójną edycję obrazów oraz zadania rozumienia obrazu, takie jak detekcja obiektów, segmentacja semantyczna, estymacja głębi i krawędzi (Canny), synteza nowych widoków i super-rozdzielczość.

Architektura łączy enkoder tekstu Qwen2.5-VL z backbone'em MMDiT; w raporcie technicznym opisano wyrównywanie reprezentacji latentnych między Qwen2.5-VL a MMDiT oraz progresywną strategię treningu od prostych do akapitowych opisów tekstowych. Model jest dystrybuowany przez Hugging Face i ModelScope.

Klasyfikacja
Model generowania obrazówModel multimodalny
Rodzina: Qwen
Dostęp i wdrożenie
PobieranieHostowane
LokalnieChmura
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 20B (MMDiT)
📥 Wejście: tekst, obraz

Specyfikacja techniczna

Parametry
20B (MMDiT)
parametrów
Licencja
Apache-2.0
Wymagania sprzętowe
Model dyfuzyjny klasy ~20B — lokalne uruchomienie wymaga GPU z dużą ilością VRAM; dokładne wymagania zależą od rozdzielczości, precyzji (BF16) i trybu (generacja vs edycja).
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
image

Możliwości i zastosowania

Natywne możliwości modelu
Generowanie obrazu z tekstu (text-to-image)
Zdolnosc modelu do tworzenia obrazow na podstawie opisu tekstowego (promptu), w tym kontroli stylu, kompozycji, proporcji i renderowania tekstu na obrazie.
Kategoria: vision
Edycja obrazów
Modyfikacja istniejącego obrazu na podstawie instrukcji tekstowej lub bezpośrednich adnotacji: usuwanie obiektów, zmiana stylu, dodawanie elementów, uzupełnianie fragmentów (inpainting/outpainting), zachowując tożsamość osób i spójność sceny.
Kategoria: vision

Architektura techniczna

Rdzeń architektury (Core Architecture)