Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

MiniMax H3: otwarty model wideo, który chce być DeepSeekiem multimediów

Pan Robocik4 sierpnia 2026 · 3 min czytania
MiniMax H3: otwarty model wideo, który chce być DeepSeekiem multimediów

MiniMax udostępnił H3 — multimodalny model generacyjny, który w jednym systemie łączy rozumienie i tworzenie tekstu, obrazu, wideo oraz dźwięku. Model ogłoszono 31 lipca 2026 na blogu firmy, a zapowiedź otwarcia wag ma odróżnić go od zamkniętych rywali pokroju Sory, Seedance czy Keling.

Najważniejsze w skrócie

  • H3 generuje wideo do 15 sekund w rozdzielczości 2K z wbudowaną ścieżką stereo tworzoną razem z obrazem
  • Według rankingu Artificial Analysis (stan na 31 lipca 2026) H3 zajął 1. miejsce w edycji wideo, 2. w text-to-video i 3. w image-to-video
  • Cena wyjścia 2K to 0,8 juana (ok. 0,45 zł) za sekundę — poniżej jednej trzeciej stawek konkurencji
  • Autorski enkoder H3-VAE skraca długość sekwencji około 4× względem rywali
  • Wagi modelu mają trafić do otwartego pobrania „w ciągu kilku dni”

Jeden model zamiast osobnych narzędzi

Dotychczasowe generatory wideo zwykle robiły jedną rzecz: zamieniały tekst na film albo obraz w ruch. H3 idzie szerzej — przetwarza tekst, obraz, wideo i dźwięk w jednym kontekście i zwraca gotowy materiał audio-wideo, bez doklejania dźwięku na końcu. W praktyce oznacza to na przykład przeniesienie ruchu z jednego klipu na inny (V2V: przeniesienie ruchu z jednego klipu wideo na inny — video-to-video) czy zachowanie napisów, logotypów i tekstu na ekranie mimo zmian perspektywy, oświetlenia i ruchu kamery — słaby punkt większości modeli generatywnych.

Firma opisuje H3 jako „DeepSeeka dla multimediów”. To odwołanie do strategii, w której przewagę buduje się nie tyle najlepszym pojedynczym wynikiem, co połączeniem otwartości i niskiej ceny. Podobną logikę widać było przy chińskich modelach językowych, które zbijały koszty inferencji do poziomu, którego zamknięci gracze nie chcieli dotknąć.

Wyniki i cena

Najmocniejszy argument H3 to edycja wideo — według Artificial Analysis model prowadzi tu globalnie, wyprzedzając zamknięte alternatywy. W pozostałych kategoriach plasuje się w ścisłej czołówce, co daje mu miejsce w najwyższym segmencie bez dominacji w każdej z nich.

KategoriaPozycja H3
Edycja wideo1. miejsce
Text-to-video2. miejsce
Image-to-video3. miejsce
Ranking Artificial Analysis, stan na 31 lipca 2026.

Cena jest tu równie istotna jak jakość. Wyjście 2K kosztuje poniżej jednej trzeciej tego, co pobierają konkurenci, a materiał 768p — poniżej połowy typowej stawki za 720p. Za tą ekonomią stoi warstwa techniczna: enkoder H3-VAE skraca sekwencję około czterokrotnie, mechanizm Contextual Omni Representation redukuje kontekst z około 100 tys. tokenów do średnio 4 tys., a architektura H3-Omni Transformer rozdziela zadania rozumienia i generowania, podnosząc przepustowość treningu o około 30%.

¥0,8 / sCena wyjścia 2K — poniżej jednej trzeciej stawek konkurencjiMiniMax

Reakcja rynku była natychmiastowa — notowana w Hongkongu spółka podskoczyła o ponad 10%, do 249,4 HK$, jak podaje tmtpost.

Dlaczego to ważne?

Generowanie wideo było dotąd domeną zamkniętych, drogich systemów. Jeśli MiniMax faktycznie otworzy wagi flagowego modelu wideo, przesunie punkt odniesienia dla całej kategorii — tak jak otwarte modele językowe zmusiły rynek do obniżek. Kluczowe jest połączenie: konkurencyjna jakość w edycji wideo, cena poniżej jednej trzeciej stawek rywali i możliwość lokalnego uruchomienia. Dla studiów reklamowych, e-commerce i twórców gier oznacza to potencjalnie kontrolę nad kosztem i danymi, której nie daje zamknięte API. Otwartość pozostaje jednak zapowiedzią, nie faktem.

Co dalej?

  • MiniMax zapowiedział udostępnienie wag H3 „w ciągu kilku dni” od 31 lipca, z zastrzeżeniem zgodności z przepisami — realny termin i licencja zdecydują o skali adopcji
  • Otwarcie wag pozwoli niezależnie zweryfikować deklarowane wyniki Artificial Analysis i koszty inferencji na własnym sprzęcie

Źródła

Udostępnij ten artykuł