Robocikowo>ROBOCIKOWO
MiniMax-Music3

MiniMax-Music3

3
Model generowania muzyki od MiniMax. Na podstawie tekstu piosenki i opisu stylu tworzy kompletne utwory do 5 minut z wokalem, w formacie 32 kHz stereo.
✓ Aktywny✓ Publiczny dostęp⚖ Open weightsModel audio
Okno kontekstowe
5K tokenów (prompt)
tokenów
Parametry
8B Global LLM + 0.6B Local LLM (+ 2.4B Flow Matching, 123M Flow-VAE)
parametrów
Data premiery
7 sierpnia 2026
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

MiniMax Music 3 (MiniMax-Music3) to model generowania muzyki opracowany przez chińską firmę MiniMax. Na podstawie tekstu piosenki (z opcjonalnymi znacznikami sekcji, np. [Verse], [Chorus]) oraz opisu stylu tworzy kompletne, spójne strukturalnie utwory o długości do pięciu minut, z wokalem i rozwijającą się aranżacją. Wyjściem jest dźwięk 32 kHz, 16-bit, stereo (WAV).

Model łączy hierarchiczną architekturę autoregresyjną z syntezą opartą na Flow Matching i Flow-VAE. Globalny model językowy (8B, inicjalizowany z Qwen3-8B) modeluje długozakresową strukturę utworu, a lokalny model językowy (0.6B) odtwarza szczegóły akustyczne w obrębie ramki. Moduł syntezy (Flow Matching 2.4B i dekoder Flow-VAE 123M) generuje ciągłą reprezentację dźwięku. Tokenizer treningowy używa ośmiu warstw Residual Vector Quantization (RVQ).

Wagi modelu są dostępne publicznie na Hugging Face na licencji MiniMax-Music3 Community License. Inferencja wymaga GPU NVIDIA (CUDA) i jest wspierana m.in. przez SGLang-Omni, diffusers i ComfyUI. Obsługiwane jest wyłącznie generowanie non-streaming, a tokenizowany prompt tekstowy jest ograniczony do 5000 tokenów.

Klasyfikacja
Model audio
Zastosowania
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
📏 Kontekst: 5K tokenów (prompt)
🧩 Parametry: 8B Global LLM + 0.6B Local LLM (+ 2.4B Flow Matching, 123M Flow-VAE)
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
5K tokenów (prompt)
tokenów
Parametry
8B Global LLM + 0.6B Local LLM (+ 2.4B Flow Matching, 123M Flow-VAE)
parametrów
Licencja
MiniMax-Music3 Community License
Wymagania sprzętowe
Inferencja wymaga GPU NVIDIA (CUDA). Obsługiwane frameworki: SGLang-Omni/SGLang, diffusers, ComfyUI. Tylko generowanie non-streaming.
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
audio

Możliwości i zastosowania

Natywne możliwości modelu
Generowanie audio
Generowanie ścieżki dźwiękowej, w tym dźwięku zsynchronizowanego z obrazem wideo.
Kategoria: audio
Generowanie muzyki
Tworzenie kompletnych utworów muzycznych (z wokalem i aranżacją) na podstawie tekstu piosenki i opisu stylu.
Kategoria: audio
Dziedziny zastosowań

Architektura techniczna

Rdzeń architektury (Core Architecture)