DeepSeek udostępnił na Hugging Face model DeepSeek-V4-Flash-Vision-Exp, pierwszy multimodalny wariant rodziny V4, wydany na licencji MIT. Rozszerza architekturę DeepSeek-V4-Flash o wieżę wizyjną i doszkolenie pod zadania agentowe wymagające analizy obrazów, wykresów i zrzutów ekranu. Na dwóch benchmarkach multimodalnych model wypada lepiej niż zamknięte Opus-4.8.
Najważniejsze w skrócie
- 304,6 mld parametrów, MoE z 256 ekspertami routowanymi, sześciu aktywnych na token
- Kontekst do 1 048 576 tokenów, rozszerzony z 65 536 metodą YaRN
- ApexBench Pass@1: 36,5 pkt wobec 26,2 dla poprzednika 0731
- Agents' Last Exam: 27,3 pkt, powyżej Opus-4.8 z wynikiem 25,7
- Licencja MIT, checkpoint około 168 GB rozbity na 48 shardów
Wieża wizyjna na bazie Flasha
Rdzeń językowy to MoE złożone z 256 ekspertów routowanych?Routing w MoE: Router w warstwie MoE wybiera dla każdego tokena kilku ekspertów z całej puli, a reszta sieci pozostaje bezczynna. Dzięki temu model o 304,6 mld parametrów przelicza na token tylko ich ułamek. i jednego współdzielonego, przy czym na token aktywuje sześciu. Enkoder wizyjny działa jako osobna wieża doklejona do rdzenia językowego. Z bazowego Flasha model dziedziczy DFlash attention, Hyper-Connections i DSpark, czyli wbudowaną ścieżkę dekodowania spekulatywnego.
Specyfikacja architektury w skrócie:
Zyski tam, gdzie trzeba patrzeć
Największy skok przynosi ApexBench, ale mocniejszym sygnałem są Agents' Last Exam i ZeroBench: na obu otwarty model wyprzedza Opus-4.8.
| Model | ApexBench | ALE | ZeroBench | Terminal 2.1 | DeepSWE | Toolathlon |
|---|---|---|---|---|---|---|
| V4-Flash-Vision-Exp | 36,5 | 27,3 | 35,0 | 83,9 | 59,3 | 75,9 |
| V4-Flash-0731 | 26,2 | — | — | 82,7 | 54,4 | 70,3 |
| Opus-4.8 | — | 25,7 | 34,0 | — | — | — |
Doszkolenie wizyjne nie zaszkodziło zadaniom tekstowym — Terminal Bench 2.1, DeepSWE i Toolathlon-Verified idą w górę. Dystans do Opus-4.8 pozostaje jednak wyraźny w generowaniu repozytoriów (57,7 wobec 69,7) i trudniejszej analizie danych (63,6 wobec 71,7).
Próg sprzętowy
Uruchomienie wymaga sprzętu klasy data center. Receptura vLLM podaje jako konfigurację odniesienia jeden tray GB200 NVL4 i około 202 GB VRAM przed alokacją KV cache. Eksperci trzymani są w FP4, pozostałe wagi w FP8, a wieża wizyjna w BF16.
Dlaczego to ważne?
Model z otwartymi wagami na licencji MIT, który na części zadań multimodalnych dorównuje zamkniętej czołówce, przesuwa punkt odniesienia dla zespołów budujących agentów na własnej infrastrukturze. Liczy się nie pojedynczy wynik, lecz kombinacja: swobodna licencja, przewidywalny koszt wnioskowania i brak zależności od API dostawcy. Dopisek Exp w nazwie sygnalizuje jednak, że DeepSeek traktuje ten wariant jako poligon doświadczalny, a nie produkt gotowy do wdrożeń produkcyjnych.
Co dalej?
- Receptura vLLM wskazuje NVIDIĘ jako jedyną potwierdzoną platformę — buildy ROCm i XPU nie obsługują ścieżki wizyjnej
- DeepSeek nie opublikował raportu technicznego ani terminu wydania stabilnego wariantu multimodalnego
Źródła
- Hugging Face — DeepSeek-V4-Flash-Vision-Exp
- vLLM Recipes — DeepSeek-V4-Flash-Vision-Exp serving guide





