
Stable Diffusion 3.5
Model text-to-image Stability AI (MMDiT): warianty Large 8,1B, Large Turbo i Medium 2,5B; otwarte wagi na licencji społecznościowej Stability AI.
Parametry
8.1B (Large) / 2.5B (Medium)
parametrów
Data premiery
22 października 2024
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Zastosowania
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 8.1B (Large) / 2.5B (Medium)
✓ Fine-tuning
📥 Wejście: tekst
Specyfikacja techniczna
Parametry
8.1B (Large) / 2.5B (Medium)
parametrów
Licencja
Stability AI Community License
Wymagania sprzętowe
Modele z otwartymi wagami (licencja społecznościowa Stability AI) na Hugging Face; kod inferencji na GitHubie. Wariant Medium działa na kartach konsumenckich (ok. 9,9 GB VRAM bez enkoderów tekstu), Large wymaga GPU o większej pamięci. Dostępny też przez API Stability AI i platformy (Replicate, Fireworks AI, DeepInfra, ComfyUI).
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
image
Możliwości i zastosowania
Natywne możliwości modelu
Generowanie obrazów z tekstu
Generowanie obrazu z opisu tekstowego (promptu). Model interpretuje polecenie w języku naturalnym i tworzy nową, spójną wizualizację od zera — bez obrazu wejściowego.
Kategoria: vision
Renderowanie tekstu w obrazach
Generowanie obrazów zawierających czytelny, poprawnie pisany tekst — infografiki, plakaty, karty menu, kody QR, napisy w wybranym stylu graficznym. Kluczowa zdolność odróżniająca modele nowej generacji od wczesnych generatorów.
Kategoria: vision
Generowanie z referencjami
Tworzenie obrazów w oparciu o wskazane wcześniej referencje wizualne — konkretną postać, styl artystyczny, produkt, przestrzeń — z zachowaniem podobieństwa i cech charakterystycznych.
Kategoria: vision
Architektura techniczna
Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)