Alibaba opublikowała na Hugging Face Qwen-Image-2.1 — model łączący generowanie obrazów z edycją, który jako pierwszy w tej linii wypuszcza obrazy z kanałem alfa. Repozytorium powstało 14 września, kartę modelu zaktualizowano 30 września. Zmieniła się też licencja: zamiast Apache 2.0 obowiązuje Qwen Research License.
Najważniejsze w skrócie
- 7B parametrów w części generującej obraz, 32 warstwy Single-Stream DiT
- Natywne wyjście RGBA — obrazy z kanałem alfa bez osobnego wycinania tła
- Edycja z użyciem do 10 obrazów referencyjnych w tym samym modelu
- Licencja qwen-research zamiast Apache 2.0 znanej z pierwszego Qwen-Image
- 70 687 pobrań i 2 709 polubień na Hugging Face
Mniejszy rdzeń, ten sam zestaw zadań
Pierwszy Qwen-Image z sierpnia 2025 był modelem 20B MMDiT. W Qwen-Image-2.1 część generująca obraz ma 7B parametrów i 32 warstwy Single-Stream DiT. Karta modelu tłumaczy to mechanizmem mixed-granularity attention i ponownym użyciem prefiksu KV cache, a całość reklamuje hasłem „strong image quality at low computational cost”.
| Element | Qwen-Image (sierpień 2025) | Qwen-Image-2.1 |
|---|---|---|
| Część generująca obraz | 20B MMDiT | 7B, 32 warstwy Single-Stream DiT |
| Licencja | Apache 2.0 | Qwen Research License |
| Wyjście RGBA | brak | wbudowane |
| Edycja w tym samym modelu | osobne wydania Edit | do 10 obrazów referencyjnych |
Co siedzi w plikach konfiguracyjnych
Karta modelu podaje architekturę ogólnie, ale repozytorium zawiera konkret. Plik `transformer/config.json` opisuje rdzeń generujący obraz:
{
"_class_name": "QwenImage21Transformer2DModel",
"num_layers": 32,
"num_attention_heads": 32,
"attention_head_dim": 128,
"context_in_dim": 4096,
"in_channels": 64,
"out_channels": 64,
"mlp_ratio": 3,
"causal_condition": true
}Iloczyn dwóch liczb z tego pliku daje trzecią, a ta nie jest przypadkowa:
Znaczenie symboli
- …
- liczba głów uwagi (num\_attention\_heads)
- …
- wymiar jednej głowy (attention\_head\_dim)
- …
- wymiar wejścia kontekstu — tyle samo, ile hidden size Qwen3-VL
Za rozumienie promptu odpowiada osobny, większy klocek — encoderem tekstu jest Qwen3-VL: 36 warstw, hidden size 4096, 8 głów KV w układzie GQA i okno 262 144 pozycji. Próbkowaniem steruje FlowMatchEulerDiscreteScheduler, więc model korzysta z flow matching, nie z klasycznego dyfuzyjnego harmonogramu.
Diagram odtwarza składniki zadeklarowane w model_index.json — nie jest rekonstrukcją ani uproszczeniem redakcyjnym. Rozumienie promptu i generowanie obrazu to dwa osobne bloki o różnych rozmiarach.
Przezroczystość i edycja w jednym checkpoincie
Nowością w tej wersji jest wyjście RGBA — model generuje obrazy z kanałem alfa?kanał alfa: Czwarty kanał obrazu obok czerwonego, zielonego i niebieskiego. Trzyma informację o przezroczystości każdego piksela, dzięki czemu tło nie wymaga wycinania. bez osobnego kroku usuwania tła. Ten sam checkpoint obsługuje text-to-image i edycję: przyjmuje do 10 obrazów referencyjnych, pozwala wskazywać obszary kółkami, adnotacjami lub maskami i wyciągać obiekt ze zdjęcia. Obsługiwane proporcje to 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 i 9:16.
Czego karta modelu nie podaje
Nie ma ani jednej liczby benchmarkowej. Deklaracje o lepszej typografii, oświetleniu portretowym i detalach pochodzą wyłącznie od producenta i nie da się ich dziś zestawić z 2.0 ani z konkurencją. Repozytorium GitHub QwenLM/Qwen-Image w ogóle nie dokumentuje wersji 2.1 — ostatni wpis w changelogu to Qwen-Image-2.0 z 10 lutego 2026.
Dlaczego to ważne?
Zmiana licencji waży tu więcej niż specyfikacja. Apache 2.0 pozwalała wdrażać model komercyjnie bez pytania kogokolwiek o zgodę, licencja badawcza tego nie gwarantuje — a ta linia budowała pozycję właśnie jako otwarta alternatywa dla zamkniętych generatorów. Mniejszy rdzeń obniża próg sprzętowy, ale bez benchmarków nie wiadomo, ile jakości kosztuje. Dla zespołów planujących produkcyjne wdrożenie warunki licencji przesądzają sprawę wcześniej niż jakiekolwiek wyniki.
Co dalej?
- Brak benchmarków w karcie modelu oznacza, że porównanie 2.1 z Qwen-Image-2.0 wymaga niezależnych testów społeczności
- Warunki komercyjnego użycia reguluje plik LICENSE w repozytorium, a nie Apache 2.0 — to trzeba sprawdzić przed wdrożeniem
Źródła
- Hugging Face — Qwen/Qwen-Image-2.1
- GitHub — QwenLM/Qwen-Image





