Robocikowo>ROBOCIKOWO
Qwen-Image-2.1

Qwen-Image-2.1

2.1 · Rodzina: Qwen
Model generacji i edycji obrazu z rodziny Qwen (Alibaba). Lekka architektura Single-Stream DiT (ok. 7B), text-to-image, edycja referencyjna i natywna przezroczystość (RGBA).
✓ Aktywny✓ Publiczny dostęp⚖ Open weightsModel generowania obrazówModel multimodalny📁 Qwen
Parametry
~7B (komponent generacji wizualnej)
parametrów
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Qwen-Image-2.1 to model generacji i edycji obrazu rozwijany przez zespół Qwen (Tongyi Lab) należący do Alibaba. Wchodzi w skład rodziny Qwen-Image, zapoczątkowanej bazowym modelem Qwen-Image (20B MMDiT) z sierpnia 2025 roku. Wersja 2.1 stawia na lekką, wydajną architekturę Single-Stream DiT (ok. 7B parametrów komponentu generacji wizualnej, 32 warstwy) z mieszaną ziarnistością uwagi (mixed-granularity attention) i ponownym wykorzystaniem prefiksowego cache KV.

Model łączy w jednym systemie generację obrazu z tekstu (text-to-image) oraz edycję obrazu. Obsługuje natywne generowanie obrazów z przezroczystością (RGBA), edycję referencyjną z użyciem nawet 10 obrazów odniesienia, lokalną edycję sterowaną okręgami, adnotacjami lub maskami, zachowanie tożsamości osób i produktów oraz renderowanie tekstu na obrazie.

Wagi modelu są publicznie dostępne do pobrania na Hugging Face na licencji Qwen Research License. W odróżnieniu od bazowego Qwen-Image (Apache-2.0), wersja 2.1 jest objęta bardziej restrykcyjną licencją badawczą.

Klasyfikacja
Model generowania obrazówModel multimodalny
Rodzina: Qwen
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: ~7B (komponent generacji wizualnej)
📥 Wejście: tekst, obraz

Specyfikacja techniczna

Parametry
~7B (komponent generacji wizualnej)
parametrów
Licencja
Qwen Research License
Wymagania sprzętowe
Wymaga GPU z pamięcią wystarczającą dla modelu dyfuzyjnego klasy ~7B; dokładne wymagania zależą od rozdzielczości i trybu (generacja vs edycja).
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
image

Możliwości i zastosowania

Natywne możliwości modelu
Generowanie obrazu z tekstu (text-to-image)
Zdolnosc modelu do tworzenia obrazow na podstawie opisu tekstowego (promptu), w tym kontroli stylu, kompozycji, proporcji i renderowania tekstu na obrazie.
Kategoria: vision
Edycja obrazów
Modyfikacja istniejącego obrazu na podstawie instrukcji tekstowej lub bezpośrednich adnotacji: usuwanie obiektów, zmiana stylu, dodawanie elementów, uzupełnianie fragmentów (inpainting/outpainting), zachowując tożsamość osób i spójność sceny.
Kategoria: vision

Architektura techniczna

Rdzeń architektury (Core Architecture)