MiniMax udostępnił H3 — multimodalny model generacyjny, który w jednym systemie łączy rozumienie i tworzenie tekstu, obrazu, wideo oraz dźwięku. Model ogłoszono 31 lipca 2026 na blogu firmy, a zapowiedź otwarcia wag ma odróżnić go od zamkniętych rywali pokroju Sory, Seedance czy Keling.
Najważniejsze w skrócie
- H3 generuje wideo do 15 sekund w rozdzielczości 2K z wbudowaną ścieżką stereo tworzoną razem z obrazem
- Według rankingu Artificial Analysis (stan na 31 lipca 2026) H3 zajął 1. miejsce w edycji wideo, 2. w text-to-video i 3. w image-to-video
- Cena wyjścia 2K to 0,8 juana (ok. 0,45 zł) za sekundę — poniżej jednej trzeciej stawek konkurencji
- Autorski enkoder H3-VAE skraca długość sekwencji około 4× względem rywali
- Wagi modelu mają trafić do otwartego pobrania „w ciągu kilku dni”
Jeden model zamiast osobnych narzędzi
Dotychczasowe generatory wideo zwykle robiły jedną rzecz: zamieniały tekst na film albo obraz w ruch. H3 idzie szerzej — przetwarza tekst, obraz, wideo i dźwięk w jednym kontekście i zwraca gotowy materiał audio-wideo, bez doklejania dźwięku na końcu. W praktyce oznacza to na przykład przeniesienie ruchu z jednego klipu na inny (V2V?V2V: przeniesienie ruchu z jednego klipu wideo na inny — video-to-video) czy zachowanie napisów, logotypów i tekstu na ekranie mimo zmian perspektywy, oświetlenia i ruchu kamery — słaby punkt większości modeli generatywnych.
Firma opisuje H3 jako „DeepSeeka dla multimediów”. To odwołanie do strategii, w której przewagę buduje się nie tyle najlepszym pojedynczym wynikiem, co połączeniem otwartości i niskiej ceny. Podobną logikę widać było przy chińskich modelach językowych, które zbijały koszty inferencji do poziomu, którego zamknięci gracze nie chcieli dotknąć.
Wyniki i cena
Najmocniejszy argument H3 to edycja wideo — według Artificial Analysis model prowadzi tu globalnie, wyprzedzając zamknięte alternatywy. W pozostałych kategoriach plasuje się w ścisłej czołówce, co daje mu miejsce w najwyższym segmencie bez dominacji w każdej z nich.
| Kategoria | Pozycja H3 |
|---|---|
| Edycja wideo | 1. miejsce |
| Text-to-video | 2. miejsce |
| Image-to-video | 3. miejsce |
Cena jest tu równie istotna jak jakość. Wyjście 2K kosztuje poniżej jednej trzeciej tego, co pobierają konkurenci, a materiał 768p — poniżej połowy typowej stawki za 720p. Za tą ekonomią stoi warstwa techniczna: enkoder H3-VAE skraca sekwencję około czterokrotnie, mechanizm Contextual Omni Representation redukuje kontekst z około 100 tys. tokenów do średnio 4 tys., a architektura H3-Omni Transformer rozdziela zadania rozumienia i generowania, podnosząc przepustowość treningu o około 30%.
Reakcja rynku była natychmiastowa — notowana w Hongkongu spółka podskoczyła o ponad 10%, do 249,4 HK$, jak podaje tmtpost.
Dlaczego to ważne?
Generowanie wideo było dotąd domeną zamkniętych, drogich systemów. Jeśli MiniMax faktycznie otworzy wagi flagowego modelu wideo, przesunie punkt odniesienia dla całej kategorii — tak jak otwarte modele językowe zmusiły rynek do obniżek. Kluczowe jest połączenie: konkurencyjna jakość w edycji wideo, cena poniżej jednej trzeciej stawek rywali i możliwość lokalnego uruchomienia. Dla studiów reklamowych, e-commerce i twórców gier oznacza to potencjalnie kontrolę nad kosztem i danymi, której nie daje zamknięte API. Otwartość pozostaje jednak zapowiedzią, nie faktem.
Co dalej?
- MiniMax zapowiedział udostępnienie wag H3 „w ciągu kilku dni” od 31 lipca, z zastrzeżeniem zgodności z przepisami — realny termin i licencja zdecydują o skali adopcji
- Otwarcie wag pozwoli niezależnie zweryfikować deklarowane wyniki Artificial Analysis i koszty inferencji na własnym sprzęcie
Źródła
- MiniMax — MiniMax H3
- TMTPost — 天下苦闭源模型久矣,MiniMax要做多模态领域的Deepseek





