Model text-to-image Black Forest Labs (12B, transformer rectified flow): warianty [pro]/[dev]/[schnell]; jakość porównywalna z DALL·E 3 i Midjourney 6.
Parametry
12B
parametrów
Data premiery
1 sierpnia 2024
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Zastosowania
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 12B
✓ Fine-tuning
📥 Wejście: tekst, obraz
Specyfikacja techniczna
Parametry
12B
parametrów
Licencja
[schnell]: Apache 2.0; [dev]: licencja niekomercyjna (source-available); [pro]: własnościowa (API)
Wymagania sprzętowe
Warianty [schnell] i [dev] mają otwarte/udostępnione wagi (Hugging Face) i można je uruchamiać lokalnie na GPU o odpowiedniej pamięci VRAM (12 mld parametrów; wersje skwantyzowane zmniejszają wymagania). Wariant [pro] dostępny wyłącznie przez API (m.in. Black Forest Labs / partnerzy).
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
image
Możliwości i zastosowania
Natywne możliwości modelu
Generowanie obrazów z tekstu
Generowanie obrazu z opisu tekstowego (promptu). Model interpretuje polecenie w języku naturalnym i tworzy nową, spójną wizualizację od zera — bez obrazu wejściowego.
Kategoria: vision
Edycja obrazów
Modyfikacja istniejącego obrazu na podstawie instrukcji tekstowej lub bezpośrednich adnotacji: usuwanie obiektów, zmiana stylu, dodawanie elementów, uzupełnianie fragmentów (inpainting/outpainting), zachowując tożsamość osób i spójność sceny.
Kategoria: vision
Renderowanie tekstu w obrazach
Generowanie obrazów zawierających czytelny, poprawnie pisany tekst — infografiki, plakaty, karty menu, kody QR, napisy w wybranym stylu graficznym. Kluczowa zdolność odróżniająca modele nowej generacji od wczesnych generatorów.
Kategoria: vision
Generowanie z referencjami
Tworzenie obrazów w oparciu o wskazane wcześniej referencje wizualne — konkretną postać, styl artystyczny, produkt, przestrzeń — z zachowaniem podobieństwa i cech charakterystycznych.
Kategoria: vision
Architektura techniczna
Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)
