Robocikowo>ROBOCIKOWO
Stable Diffusion 3.5

Stable Diffusion 3.5

Stable Diffusion 3.5 (Large 8.1B / Large Turbo / Medium 2.5B) · Rodzina: Stable Diffusion
Model text-to-image Stability AI (MMDiT): warianty Large 8,1B, Large Turbo i Medium 2,5B; otwarte wagi na licencji społecznościowej Stability AI.
✓ Aktywny✓ Publiczny dostęp⚖ Open weightsModel generowania obrazów📁 Stable Diffusion
Parametry
8.1B (Large) / 2.5B (Medium)
parametrów
Data premiery
22 października 2024
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Stable Diffusion 3.5 to najnowsza generacja rodziny modeli generowania obrazów z tekstu Stability AI, ogłoszona 22 października 2024 r. (wariant Medium dodano 29 października 2024 r.). Modele oparte są na ulepszonej architekturze Multimodal Diffusion Transformer (MMDiT), z m.in. normalizacją Query-Key w blokach transformera.

Rodzina obejmuje trzy główne warianty: Large (8,1 mld parametrów, do zastosowań profesjonalnych, rozdzielczość ok. 1 megapiksela), Large Turbo (wersja destylowana generująca wysokiej jakości obrazy w 4 krokach, z bardzo dobrym trzymaniem się promptu) oraz Medium (2,5 mld parametrów, rozdzielczość 0,25–2 megapiksela, zoptymalizowany pod sprzęt konsumencki — wariant Medium używa architektury MMDiT-X).

Modele wyróżniają się dobrym trzymaniem się promptu, różnorodnością generowanych postaci (m.in. odcieni skóry i cech) oraz wszechstronnością stylów — od fotografii i malarstwa po grafikę 3D. Wariant Medium można uruchomić na kartach konsumenckich, wymagając ok. 9,9 GB pamięci VRAM (bez enkoderów tekstu).

Stable Diffusion 3.5 udostępniono na licencji społecznościowej Stability AI (Stability AI Community License), która pozwala na bezpłatne użycie niekomercyjne oraz komercyjne dla organizacji o rocznych przychodach poniżej 1 mln USD; użytkownicy zachowują prawa do wygenerowanych obrazów. Wagi są dostępne na Hugging Face, kod inferencji na GitHubie, a model także przez API Stability AI oraz platformy takie jak Replicate, Fireworks AI, DeepInfra i ComfyUI.

Klasyfikacja
Model generowania obrazów
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 8.1B (Large) / 2.5B (Medium)
✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Parametry
8.1B (Large) / 2.5B (Medium)
parametrów
Licencja
Stability AI Community License
Wymagania sprzętowe
Modele z otwartymi wagami (licencja społecznościowa Stability AI) na Hugging Face; kod inferencji na GitHubie. Wariant Medium działa na kartach konsumenckich (ok. 9,9 GB VRAM bez enkoderów tekstu), Large wymaga GPU o większej pamięci. Dostępny też przez API Stability AI i platformy (Replicate, Fireworks AI, DeepInfra, ComfyUI).
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
image

Możliwości i zastosowania

Natywne możliwości modelu
Generowanie obrazów z tekstu
Generowanie obrazu z opisu tekstowego (promptu). Model interpretuje polecenie w języku naturalnym i tworzy nową, spójną wizualizację od zera — bez obrazu wejściowego.
Kategoria: vision
Renderowanie tekstu w obrazach
Generowanie obrazów zawierających czytelny, poprawnie pisany tekst — infografiki, plakaty, karty menu, kody QR, napisy w wybranym stylu graficznym. Kluczowa zdolność odróżniająca modele nowej generacji od wczesnych generatorów.
Kategoria: vision
Generowanie z referencjami
Tworzenie obrazów w oparciu o wskazane wcześniej referencje wizualne — konkretną postać, styl artystyczny, produkt, przestrzeń — z zachowaniem podobieństwa i cech charakterystycznych.
Kategoria: vision

Architektura techniczna

Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)