Robocikowo>ROBOCIKOWO
Obsługa wielu formatów danych

Text-to-Image

2021AktywnyOpublikowano: 1 października 2026Aktualizacja: 1 października 2026Opublikowany
Zadanie generatywne: tworzenie obrazu na podstawie opisu w języku naturalnym (promptu), realizowane dziś głównie modelami dyfuzyjnymi oraz transformerami (DiT/MMDiT).
Kluczowa innowacja
Sprowadza tworzenie obrazów do warunkowanego generowania z opisu w języku naturalnym — model uczy się wspólnej przestrzeni tekst–obraz, dzięki czemu dowolny prompt staje się sterowalnym wejściem generatora.
Kategoria
Obsługa wielu formatów danych
Poziom abstrakcji
Paradygmat
Poziom operacji
ModelInferencja
Zastosowania
Grafika koncepcyjna i ilustracjaMarketing i projektowanie wizualnePrototypowanie produktów i mockupyZasoby do gier i filmuEdycja i inpainting obrazówDane syntetyczne do trenowania modeli wizji

Jak działa

1) Enkoder tekstu (CLIP/T5) zamienia prompt w wektory warunkujące. 2) Model generatywny tworzy obraz: w podejściu dyfuzyjnym startuje od szumu i iteracyjnie go odszumia przez N kroków, a w podejściu transformerowym/autoregresyjnym generuje tokeny obrazu. 3) Warunkowanie tekstem wprowadzane jest zwykle przez cross-attention (lub, w MMDiT, przez wspólne przetwarzanie tokenów tekstu i obrazu). 4) Classifier-Free Guidance (CFG) wzmacnia zgodność z promptem, interpolując predykcję warunkową i bezwarunkową ze skalą guidance. 5) W Latent Diffusion cały proces biegnie w przestrzeni latentnej autoenkodera, a dekoder VAE zamienia latent na finalny obraz w pełnej rozdzielczości.

Rozwiązany problem

Umożliwia tworzenie i edycję treści wizualnej bez umiejętności graficznych ani zasobów produkcyjnych — zamiast ręcznego rysowania wystarczy opis słowny. Rozwiązuje problem sterowalnej, otwartej generacji obrazów z dowolnego promptu (zero-shot), zamiast ograniczania się do wąskich domen czy sztywnych szablonów.

Komponenty

Enkoder tekstuWarunkowanie semantyczne

Zamienia prompt w reprezentację warunkującą generator. Spotykane są enkodery kontrastowe (CLIP) oraz językowe (T5); Imagen pokazał skuteczność dużych enkoderów T5 trenowanych tylko na tekście.

Oficjalna

Model generatywnySynteza obrazu

Rdzeń syntezujący obraz. Współcześnie najczęściej dyfuzyjny backbone (U-Net lub Diffusion Transformer / MMDiT); historycznie GAN lub autoregresyjny transformer na tokenach obrazu.

Oficjalna

Warunkowanie (cross-attention)Sterowanie promptem

Łączy reprezentację tekstu z procesem generacji — zwykle przez cross-attention między tokenami obrazu a embeddingami tekstu; w MMDiT tekst i obraz przetwarzane są wspólnym transformerem z dwukierunkowym przepływem informacji.

Oficjalna

Guidance (CFG)Wzmocnienie zgodności z tekstem

Technika zwiększająca zgodność obrazu z promptem przez interpolację predykcji warunkowej i bezwarunkowej, sterowana skalą guidance. Spopularyzowana w GLIDE dla text-to-image.

Oficjalna

Implementacja

Pułapki implementacyjne
Zbyt wysoka skala guidanceŚrednia

Nadmierny CFG przesyca kolory i artefakty oraz redukuje różnorodność wyników.

Rozwiązanie:Dobierać skalę empirycznie dla danego modelu; rozważyć dynamic/rescaled CFG.
Za mało kroków próbkowaniaŚrednia

Zbyt mała liczba kroków daje rozmyte lub niespójne obrazy przy standardowych samplerach.

Rozwiązanie:Zwiększyć liczbę kroków lub użyć samplerów/modeli destylowanych (few-step, rectified flow).
Słaba zgodność z promptem (binding atrybutów)Wysoka

Modele mylą przypisanie atrybutów do obiektów, liczby obiektów i relacje przestrzenne.

Rozwiązanie:Silniejszy enkoder tekstu (T5), lepszy caption podczas treningu, techniki sterowania (regional/attention guidance).
Uprzedzenia i bezpieczeństwo treściWysoka

Modele dziedziczą uprzedzenia z danych treningowych i mogą generować treści niepożądane lub naruszające prawa.

Rozwiązanie:Filtrowanie danych, klasyfikatory bezpieczeństwa, watermarking i polityki użycia.

Ewolucja

Oryginalny paper · 2021 · ICML 2021 · Aditya Ramesh
Zero-Shot Text-to-Image Generation
Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea Voss, Alec Radford, Mark Chen, Ilya Sutskever
2018
AttnGAN — text-to-image oparte na GAN z uwagą

Attentional GAN z wieloetapowym uszczegóławianiem obrazu na podstawie słów promptu (arXiv 2017, CVPR 2018).

2021
DALL·E — autoregresyjny transformer na tokenach obrazu
Punkt przełomowy

Zero-shot text-to-image modelujące wspólny strumień tokenów tekstu i obrazu (dVAE + transformer).

2021
GLIDE — dyfuzja z Classifier-Free Guidance

Pokazuje przewagę classifier-free guidance nad guidance opartym na CLIP dla text-to-image.

2022
Latent Diffusion / Stable Diffusion
Punkt przełomowy

Przeniesienie dyfuzji do przestrzeni latentnej autoenkodera; podstawa Stable Diffusion (CVPR 2022).

2022
DALL·E 2 (unCLIP) i Imagen

DALL·E 2 generuje obraz z latentów CLIP; Imagen używa dużego enkodera T5. Oba podnoszą fotorealizm dyfuzji.

2022
Diffusion Transformer (DiT)
Punkt przełomowy

Zastąpienie backbone'u U-Net transformerem działającym na patchach latentu; silne właściwości skalowania (FID vs GFLOPs).

2024
Stable Diffusion 3 (MMDiT) i FLUX.1

MMDiT z osobnymi wagami dla tekstu i obrazu oraz dwukierunkowym przepływem informacji; rectified flow. FLUX.1 od Black Forest Labs (sierpień 2024).

2025
Qwen-Image — foundation model MMDiT

Model generacji obrazu MMDiT wyróżniający się renderowaniem złożonego tekstu i precyzyjną edycją (raport techniczny, sierpień 2025).

Hiperparametry (konfigurowalne osie)

Guidance scale (CFG)Krytyczna

Siła sterowania promptem. Wyższe wartości zwiększają zgodność z tekstem, ale mogą obniżać różnorodność i naturalność.

Liczba kroków próbkowaniaWysoka

Liczba iteracji odszumiania. Więcej kroków = zwykle lepsza jakość kosztem czasu; dominujący czynnik kosztu inferencji dyfuzji.

RozdzielczośćWysoka

Docelowy rozmiar obrazu (np. 512, 1024). Rośnie kwadratowo z liczbą pikseli/tokenów, silnie wpływając na pamięć i czas.

Wąskie gardło obliczeniowe

Iteracyjne próbkowanie (sampling loop)

Wielokrotne przejścia przez sieć w pętli odszumiania (N kroków) są głównym kosztem inferencji modeli dyfuzyjnych; redukcja kroków (distillation, rectified flow) jest aktywnym kierunkiem badań.

Równoległość

Poziom równoległości
Częściowo równoległy

Obliczenia przestrzenne w obrębie jednego kroku są silnie równoległe (GPU), ale kolejne kroki odszumiania są sekwencyjne.

Zakres
TreningInferencja

Wymagania sprzętowe

Podstawowe

Gęste operacje macierzowe w U-Net/DiT i pętla próbkowania korzystają z tensor cores i dużej przepustowości pamięci.