Robocikowo>ROBOCIKOWO
MiniMax-M3-MXFP8

MiniMax-M3-MXFP8

M3 (MXFP8)
Wariant MiniMax-M3 skwantyzowany do MXFP8 (microscaling FP8). Natywnie multimodalny model MoE (~428B, ~23B aktywnych) z kontekstem 1M.
✓ Aktywny✓ Publiczny dostęp⚖ Open weightsLLMModel multimodalnyModel rozumowaniaModel używający narzędzi
Okno kontekstowe
1M
tokenów
Parametry
428B (23B active)
parametrów
Dostęp:APIDownloadHostedWdrożenie:☁ Cloud💻 Lokalnie

Przegląd

MiniMax-M3-MXFP8 to wariant modelu MiniMax-M3 opracowanego przez MiniMax, skwantyzowany do formatu MXFP8 (microscaling FP8). Kwantyzacja MXFP8 zmniejsza rozmiar wag i zuzycie pamieci przy zachowaniu jakosci modelu, ulatwiajac wdrozenie na akceleratorach obslugujacych format FP8.

Bazowy MiniMax-M3 to natywnie multimodalny model typu Mixture of Experts o okolo 428 mld parametrow, z ktorych okolo 23 mld jest aktywowanych na token. Obsluguje okno kontekstu do 1 mln tokenow dzieki mechanizmowi MiniMax Sparse Attention (MSA). Na wejsciu przyjmuje tekst, obraz i wideo, a generuje tekst.

Model wspiera prace agentowa, programowanie oraz tryby rozumowania sterowane parametrem thinking (enabled, adaptive, disabled). Wagi udostepniono na Hugging Face na licencji MiniMax Community; rekomendowane frameworki inferencyjne to SGLang, vLLM i Transformers. Model jest tez dostepny przez API oraz agenta MiniMax.

Klasyfikacja
LLMModel multimodalnyModel rozumowaniaModel używający narzędzi
Dostęp i wdrożenie
APIPobieranieHostowane
ChmuraLokalnie
Wagi: Open weights
Kluczowe parametry
📏 Kontekst: 1M
🧩 Parametry: 428B (23B active)
Narzędzia
📥 Wejście: tekst, obraz, wideo

Specyfikacja techniczna

Okno kontekstowe
1M
tokenów
Parametry
428B (23B active)
parametrów
Licencja
MiniMax Community License
Wymagania sprzętowe
Wariant MXFP8 (microscaling FP8) zmniejsza zuzycie pamieci wzgledem oryginalu w BF16. Zalecane frameworki inferencyjne: SGLang, vLLM, Transformers.
Funkcje:Używanie narzędzi
Modalności
⬇ Wejście (Input)
textimagevideo
⬆ Wyjście (Output)
text

Możliwości i zastosowania

Natywne możliwości modelu
Długi kontekst
Przetwarzanie bardzo długich danych wejściowych (dziesiątki–setki tysięcy tokenów) przy zachowaniu spójności.
Kategoria: language
Programowanie
Generowanie, uzupełnianie, wyjaśnianie i debugowanie kodu w wielu językach programowania.
Kategoria: coding
Rozumowanie
Zdolność modelu do wieloetapowego wnioskowania logicznego, rozwiązywania złożonych problemów i rozkładania zadań na kroki.
Kategoria: reasoning
Przeplatane wejście multimodalne
Zdolność do dowolnego łączenia tekstu i obrazu w dowolnej kolejności w ramach jednego polecenia.
Kategoria: reasoning
Wywoływanie funkcji
Natywne wsparcie dla ustrukturyzowanego wykorzystania narzędzi, umożliwiające przepływy pracy oparte na agentach.
Kategoria: planning

Cennik

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)