Robocikowo>ROBOCIKOWO
FLUX.1

FLUX.1

FLUX.1 ([pro] / [dev] / [schnell], 12B) · Rodzina: FLUX
Model text-to-image Black Forest Labs (12B, transformer rectified flow): warianty [pro]/[dev]/[schnell]; jakość porównywalna z DALL·E 3 i Midjourney 6.
✓ Aktywny✓ Publiczny dostęp⚖ Open weightsModel generowania obrazów📁 FLUX
Parametry
12B
parametrów
Data premiery
1 sierpnia 2024
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

FLUX.1 to model generowania obrazów opracowany przez Black Forest Labs i udostępniony w sierpniu 2024 r. Black Forest Labs to niemiecki startup z Freiburga, założony przez byłych pracowników Stability AI: Robina Rombacha, Andreasa Blattmanna i Patricka Esera.

Model tworzy obrazy z opisu w języku naturalnym (text-to-image), a także obsługuje przekształcenia obraz-w-obraz. Opiera się na blokach transformera typu rectified flow (uczenie metodą flow matching) przeskalowanych do 12 miliardów parametrów — to odejście od klasycznego podejścia dyfuzyjnego na rzecz dopasowania przepływu.

FLUX.1 ukazał się w trzech wariantach różniących się licencją i dostępem: [schnell] (open source, Apache 2.0, zoptymalizowany pod kątem szybkości), [dev] (source-available, licencja niekomercyjna, z możliwością licencji komercyjnej) oraz [pro] (własnościowy, dostępny wyłącznie przez API i licencjonowany podmiotom trzecim).

W testach FLUX.1 dorównuje jakością wiodącym modelom: pod względem wierności promptowi jest porównywalny z DALL·E 3, a fotorealizmem z Midjourney 6; wyróżnia się też lepszym generowaniem dłoni niż wcześniejsze modele (np. Stable Diffusion XL). Niezależnie od wybranego wariantu użytkownicy zachowują prawa własności do wygenerowanych obrazów.

Klasyfikacja
Model generowania obrazów
Rodzina: FLUX
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 12B
✓ Fine-tuning
📥 Wejście: tekst, obraz

Specyfikacja techniczna

Parametry
12B
parametrów
Licencja
[schnell]: Apache 2.0; [dev]: licencja niekomercyjna (source-available); [pro]: własnościowa (API)
Wymagania sprzętowe
Warianty [schnell] i [dev] mają otwarte/udostępnione wagi (Hugging Face) i można je uruchamiać lokalnie na GPU o odpowiedniej pamięci VRAM (12 mld parametrów; wersje skwantyzowane zmniejszają wymagania). Wariant [pro] dostępny wyłącznie przez API (m.in. Black Forest Labs / partnerzy).
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
image

Możliwości i zastosowania

Natywne możliwości modelu
Generowanie obrazów z tekstu
Generowanie obrazu z opisu tekstowego (promptu). Model interpretuje polecenie w języku naturalnym i tworzy nową, spójną wizualizację od zera — bez obrazu wejściowego.
Kategoria: vision
Edycja obrazów
Modyfikacja istniejącego obrazu na podstawie instrukcji tekstowej lub bezpośrednich adnotacji: usuwanie obiektów, zmiana stylu, dodawanie elementów, uzupełnianie fragmentów (inpainting/outpainting), zachowując tożsamość osób i spójność sceny.
Kategoria: vision
Renderowanie tekstu w obrazach
Generowanie obrazów zawierających czytelny, poprawnie pisany tekst — infografiki, plakaty, karty menu, kody QR, napisy w wybranym stylu graficznym. Kluczowa zdolność odróżniająca modele nowej generacji od wczesnych generatorów.
Kategoria: vision
Generowanie z referencjami
Tworzenie obrazów w oparciu o wskazane wcześniej referencje wizualne — konkretną postać, styl artystyczny, produkt, przestrzeń — z zachowaniem podobieństwa i cech charakterystycznych.
Kategoria: vision

Architektura techniczna

Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)