Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Qwen-Image-2.1: 7B zamiast 20B i zmiana licencji na badawczą

Pan Robocik6 października 2026 · 3 min czytania
Qwen-Image-2.1: 7B zamiast 20B i zmiana licencji na badawczą

Alibaba opublikowała na Hugging Face Qwen-Image-2.1 — model łączący generowanie obrazów z edycją, który jako pierwszy w tej linii wypuszcza obrazy z kanałem alfa. Repozytorium powstało 14 września, kartę modelu zaktualizowano 30 września. Zmieniła się też licencja: zamiast Apache 2.0 obowiązuje Qwen Research License.

Najważniejsze w skrócie

  • 7B parametrów w części generującej obraz, 32 warstwy Single-Stream DiT
  • Natywne wyjście RGBA — obrazy z kanałem alfa bez osobnego wycinania tła
  • Edycja z użyciem do 10 obrazów referencyjnych w tym samym modelu
  • Licencja qwen-research zamiast Apache 2.0 znanej z pierwszego Qwen-Image
  • 70 687 pobrań i 2 709 polubień na Hugging Face

Mniejszy rdzeń, ten sam zestaw zadań

Pierwszy Qwen-Image z sierpnia 2025 był modelem 20B MMDiT. W Qwen-Image-2.1 część generująca obraz ma 7B parametrów i 32 warstwy Single-Stream DiT. Karta modelu tłumaczy to mechanizmem mixed-granularity attention i ponownym użyciem prefiksu KV cache, a całość reklamuje hasłem „strong image quality at low computational cost”.

ElementQwen-Image (sierpień 2025)Qwen-Image-2.1
Część generująca obraz20B MMDiT7B, 32 warstwy Single-Stream DiT
LicencjaApache 2.0Qwen Research License
Wyjście RGBAbrakwbudowane
Edycja w tym samym modeluosobne wydania Editdo 10 obrazów referencyjnych
Co zmieniło się między pierwszym wydaniem linii a wersją 2.1.

Co siedzi w plikach konfiguracyjnych

Karta modelu podaje architekturę ogólnie, ale repozytorium zawiera konkret. Plik `transformer/config.json` opisuje rdzeń generujący obraz:

JSON
{
  "_class_name": "QwenImage21Transformer2DModel",
  "num_layers": 32,
  "num_attention_heads": 32,
  "attention_head_dim": 128,
  "context_in_dim": 4096,
  "in_channels": 64,
  "out_channels": 64,
  "mlp_ratio": 3,
  "causal_condition": true
}

Iloczyn dwóch liczb z tego pliku daje trzecią, a ta nie jest przypadkowa:

…
Wymiar wejścia kontekstu w DiT odpowiada rozmiarowi ukrytemu encodera tekstu Qwen3-VL (4096).
Znaczenie symboli
…
liczba głów uwagi (num\_attention\_heads)
…
wymiar jednej głowy (attention\_head\_dim)
…
wymiar wejścia kontekstu — tyle samo, ile hidden size Qwen3-VL

Za rozumienie promptu odpowiada osobny, większy klocek — encoderem tekstu jest Qwen3-VL: 36 warstw, hidden size 4096, 8 głów KV w układzie GQA i okno 262 144 pozycji. Próbkowaniem steruje FlowMatchEulerDiscreteScheduler, więc model korzysta z flow matching, nie z klasycznego dyfuzyjnego harmonogramu.

Wejście
Prompt tekstowy i obrazy referencyjnedo 10 referencji
Rozumienie
Qwen3-VL — encoder tekstu36 warstw, hidden size 4096, GQA
Generowanie
QwenImage21Transformer2DModel32 warstwy Single-Stream DiT, 7B
FlowMatchEulerDiscreteSchedulerpróbkowanie metodą flow matching
AutoencoderKLQwenImage21 — dekoder VAEz przestrzeni latentnej do pikseli
Wyjście
Obraz RGBAkanał alfa bez osobnego wycinania tła
Pipeline QwenImage21Pipeline w kolejności zapisanej w pliku model_index.json.

Diagram odtwarza składniki zadeklarowane w model_index.json — nie jest rekonstrukcją ani uproszczeniem redakcyjnym. Rozumienie promptu i generowanie obrazu to dwa osobne bloki o różnych rozmiarach.

Przezroczystość i edycja w jednym checkpoincie

Nowością w tej wersji jest wyjście RGBA — model generuje obrazy z kanał alfa: Czwarty kanał obrazu obok czerwonego, zielonego i niebieskiego. Trzyma informację o przezroczystości każdego piksela, dzięki czemu tło nie wymaga wycinania. bez osobnego kroku usuwania tła. Ten sam checkpoint obsługuje text-to-image i edycję: przyjmuje do 10 obrazów referencyjnych, pozwala wskazywać obszary kółkami, adnotacjami lub maskami i wyciągać obiekt ze zdjęcia. Obsługiwane proporcje to 1:1, 4:3, 3:4, 3:2, 2:3, 16:9 i 9:16.

Czego karta modelu nie podaje

Nie ma ani jednej liczby benchmarkowej. Deklaracje o lepszej typografii, oświetleniu portretowym i detalach pochodzą wyłącznie od producenta i nie da się ich dziś zestawić z 2.0 ani z konkurencją. Repozytorium GitHub QwenLM/Qwen-Image w ogóle nie dokumentuje wersji 2.1 — ostatni wpis w changelogu to Qwen-Image-2.0 z 10 lutego 2026.

Dlaczego to ważne?

Zmiana licencji waży tu więcej niż specyfikacja. Apache 2.0 pozwalała wdrażać model komercyjnie bez pytania kogokolwiek o zgodę, licencja badawcza tego nie gwarantuje — a ta linia budowała pozycję właśnie jako otwarta alternatywa dla zamkniętych generatorów. Mniejszy rdzeń obniża próg sprzętowy, ale bez benchmarków nie wiadomo, ile jakości kosztuje. Dla zespołów planujących produkcyjne wdrożenie warunki licencji przesądzają sprawę wcześniej niż jakiekolwiek wyniki.

Co dalej?

  • Brak benchmarków w karcie modelu oznacza, że porównanie 2.1 z Qwen-Image-2.0 wymaga niezależnych testów społeczności
  • Warunki komercyjnego użycia reguluje plik LICENSE w repozytorium, a nie Apache 2.0 — to trzeba sprawdzić przed wdrożeniem

Źródła

Udostępnij ten artykuł