Text-to-Image
Jak działa
1) Enkoder tekstu (CLIP/T5) zamienia prompt w wektory warunkujące. 2) Model generatywny tworzy obraz: w podejściu dyfuzyjnym startuje od szumu i iteracyjnie go odszumia przez N kroków, a w podejściu transformerowym/autoregresyjnym generuje tokeny obrazu. 3) Warunkowanie tekstem wprowadzane jest zwykle przez cross-attention (lub, w MMDiT, przez wspólne przetwarzanie tokenów tekstu i obrazu). 4) Classifier-Free Guidance (CFG) wzmacnia zgodność z promptem, interpolując predykcję warunkową i bezwarunkową ze skalą guidance. 5) W Latent Diffusion cały proces biegnie w przestrzeni latentnej autoenkodera, a dekoder VAE zamienia latent na finalny obraz w pełnej rozdzielczości.
Rozwiązany problem
Umożliwia tworzenie i edycję treści wizualnej bez umiejętności graficznych ani zasobów produkcyjnych — zamiast ręcznego rysowania wystarczy opis słowny. Rozwiązuje problem sterowalnej, otwartej generacji obrazów z dowolnego promptu (zero-shot), zamiast ograniczania się do wąskich domen czy sztywnych szablonów.
Komponenty
Zamienia prompt w reprezentację warunkującą generator. Spotykane są enkodery kontrastowe (CLIP) oraz językowe (T5); Imagen pokazał skuteczność dużych enkoderów T5 trenowanych tylko na tekście.
Oficjalna
Rdzeń syntezujący obraz. Współcześnie najczęściej dyfuzyjny backbone (U-Net lub Diffusion Transformer / MMDiT); historycznie GAN lub autoregresyjny transformer na tokenach obrazu.
Oficjalna
Łączy reprezentację tekstu z procesem generacji — zwykle przez cross-attention między tokenami obrazu a embeddingami tekstu; w MMDiT tekst i obraz przetwarzane są wspólnym transformerem z dwukierunkowym przepływem informacji.
Oficjalna
Technika zwiększająca zgodność obrazu z promptem przez interpolację predykcji warunkowej i bezwarunkowej, sterowana skalą guidance. Spopularyzowana w GLIDE dla text-to-image.
Oficjalna
Implementacja
Nadmierny CFG przesyca kolory i artefakty oraz redukuje różnorodność wyników.
Zbyt mała liczba kroków daje rozmyte lub niespójne obrazy przy standardowych samplerach.
Modele mylą przypisanie atrybutów do obiektów, liczby obiektów i relacje przestrzenne.
Modele dziedziczą uprzedzenia z danych treningowych i mogą generować treści niepożądane lub naruszające prawa.
Ewolucja
Attentional GAN z wieloetapowym uszczegóławianiem obrazu na podstawie słów promptu (arXiv 2017, CVPR 2018).
Zero-shot text-to-image modelujące wspólny strumień tokenów tekstu i obrazu (dVAE + transformer).
Pokazuje przewagę classifier-free guidance nad guidance opartym na CLIP dla text-to-image.
Przeniesienie dyfuzji do przestrzeni latentnej autoenkodera; podstawa Stable Diffusion (CVPR 2022).
DALL·E 2 generuje obraz z latentów CLIP; Imagen używa dużego enkodera T5. Oba podnoszą fotorealizm dyfuzji.
Zastąpienie backbone'u U-Net transformerem działającym na patchach latentu; silne właściwości skalowania (FID vs GFLOPs).
MMDiT z osobnymi wagami dla tekstu i obrazu oraz dwukierunkowym przepływem informacji; rectified flow. FLUX.1 od Black Forest Labs (sierpień 2024).
Model generacji obrazu MMDiT wyróżniający się renderowaniem złożonego tekstu i precyzyjną edycją (raport techniczny, sierpień 2025).
Hiperparametry (konfigurowalne osie)
Siła sterowania promptem. Wyższe wartości zwiększają zgodność z tekstem, ale mogą obniżać różnorodność i naturalność.
Liczba iteracji odszumiania. Więcej kroków = zwykle lepsza jakość kosztem czasu; dominujący czynnik kosztu inferencji dyfuzji.
Docelowy rozmiar obrazu (np. 512, 1024). Rośnie kwadratowo z liczbą pikseli/tokenów, silnie wpływając na pamięć i czas.
Wąskie gardło obliczeniowe
Wielokrotne przejścia przez sieć w pętli odszumiania (N kroków) są głównym kosztem inferencji modeli dyfuzyjnych; redukcja kroków (distillation, rectified flow) jest aktywnym kierunkiem badań.
Równoległość
Obliczenia przestrzenne w obrębie jednego kroku są silnie równoległe (GPU), ale kolejne kroki odszumiania są sekwencyjne.
Wymagania sprzętowe
Gęste operacje macierzowe w U-Net/DiT i pętla próbkowania korzystają z tensor cores i dużej przepustowości pamięci.