Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

DeepSeek-V4-Flash-Vision-Exp: pierwszy multimodalny model rodziny V4

Pan Robocik6 września 2026 · 2 min czytania
DeepSeek-V4-Flash-Vision-Exp: pierwszy multimodalny model rodziny V4

DeepSeek udostępnił na Hugging Face model DeepSeek-V4-Flash-Vision-Exp, pierwszy multimodalny wariant rodziny V4, wydany na licencji MIT. Rozszerza architekturę DeepSeek-V4-Flash o wieżę wizyjną i doszkolenie pod zadania agentowe wymagające analizy obrazów, wykresów i zrzutów ekranu. Na dwóch benchmarkach multimodalnych model wypada lepiej niż zamknięte Opus-4.8.

Najważniejsze w skrócie

  • 304,6 mld parametrów, MoE z 256 ekspertami routowanymi, sześciu aktywnych na token
  • Kontekst do 1 048 576 tokenów, rozszerzony z 65 536 metodą YaRN
  • ApexBench Pass@1: 36,5 pkt wobec 26,2 dla poprzednika 0731
  • Agents' Last Exam: 27,3 pkt, powyżej Opus-4.8 z wynikiem 25,7
  • Licencja MIT, checkpoint około 168 GB rozbity na 48 shardów

Wieża wizyjna na bazie Flasha

Rdzeń językowy to MoE złożone z 256 Routing w MoE: Router w warstwie MoE wybiera dla każdego tokena kilku ekspertów z całej puli, a reszta sieci pozostaje bezczynna. Dzięki temu model o 304,6 mld parametrów przelicza na token tylko ich ułamek. i jednego współdzielonego, przy czym na token aktywuje sześciu. Enkoder wizyjny działa jako osobna wieża doklejona do rdzenia językowego. Z bazowego Flasha model dziedziczy DFlash attention, Hyper-Connections i DSpark, czyli wbudowaną ścieżkę dekodowania spekulatywnego.

Specyfikacja architektury w skrócie:

304,6B paramsłączna liczba parametrów
43 layersgłębokość rdzenia językowego
256 routed expertspula ekspertów MoE, plus jeden współdzielony
6 active/tokenilu ekspertów liczy się na jeden token
vision 32 × 1024warstwy i wymiar wieży wizyjnej
patch 14 pxrozmiar kafelków, na jakie dzielony jest obraz
384 tok/obrazmaksymalny budżet tokenów na jeden obraz
1 048 576maksymalna długość kontekstu w tokenach, rozszerzona z 65 536 metodą YaRNKarta modelu, Hugging Face

Zyski tam, gdzie trzeba patrzeć

Największy skok przynosi ApexBench, ale mocniejszym sygnałem są Agents' Last Exam i ZeroBench: na obu otwarty model wyprzedza Opus-4.8.

ModelApexBenchALEZeroBenchTerminal 2.1DeepSWEToolathlon
V4-Flash-Vision-Exp36,527,335,083,959,375,9
V4-Flash-073126,282,754,470,3
Opus-4.825,734,0
Wyniki w punktach. ALE = Agents' Last Exam, Toolathlon = Toolathlon-Verified. Kreska oznacza brak opublikowanego wyniku dla danej pary.
Zastrzeżenie z karty modelu: poprzedni DeepSeek-V4-Flash-0731 ignorował elementy wizyjne w wejściu. Skok na ApexBench z 26,2 na 36,5 punktu jest więc po części artefaktem pomiaru — porównujemy model, który widzi, z modelem, który nie widział.

Doszkolenie wizyjne nie zaszkodziło zadaniom tekstowym — Terminal Bench 2.1, DeepSWE i Toolathlon-Verified idą w górę. Dystans do Opus-4.8 pozostaje jednak wyraźny w generowaniu repozytoriów (57,7 wobec 69,7) i trudniejszej analizie danych (63,6 wobec 71,7).

Próg sprzętowy

Uruchomienie wymaga sprzętu klasy data center. Receptura vLLM podaje jako konfigurację odniesienia jeden tray GB200 NVL4 i około 202 GB VRAM przed alokacją KV cache. Eksperci trzymani są w FP4, pozostałe wagi w FP8, a wieża wizyjna w BF16.

Dlaczego to ważne?

Model z otwartymi wagami na licencji MIT, który na części zadań multimodalnych dorównuje zamkniętej czołówce, przesuwa punkt odniesienia dla zespołów budujących agentów na własnej infrastrukturze. Liczy się nie pojedynczy wynik, lecz kombinacja: swobodna licencja, przewidywalny koszt wnioskowania i brak zależności od API dostawcy. Dopisek Exp w nazwie sygnalizuje jednak, że DeepSeek traktuje ten wariant jako poligon doświadczalny, a nie produkt gotowy do wdrożeń produkcyjnych.

Co dalej?

  • Receptura vLLM wskazuje NVIDIĘ jako jedyną potwierdzoną platformę — buildy ROCm i XPU nie obsługują ścieżki wizyjnej
  • DeepSeek nie opublikował raportu technicznego ani terminu wydania stabilnego wariantu multimodalnego

Źródła

Udostępnij ten artykuł