Robocikowo>ROBOCIKOWO
DeepSeek-V4-Flash-Vision-Exp

DeepSeek-V4-Flash-Vision-Exp

V4 Flash Vision (Exp) · Rodzina: DeepSeek
Eksperymentalny multimodalny (obraz+tekst→tekst) model DeepSeek z rodziny V4, zbudowany na DeepSeek-V4-Flash z modułami wizyjnymi. Otwarte wagi, licencja MIT.
⏳ Preview✓ Publiczny dostęp⚖ Open sourceModel multimodalnyModel wzrokowyModel rozumowania📁 DeepSeek
Okno kontekstowe
1M
tokenów
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

DeepSeek-V4-Flash-Vision-Exp to pierwszy eksperymentalny model multimodalny w rodzinie DeepSeek-V4. Powstał przez rozszerzenie architektury DeepSeek-V4-Flash o moduły wizyjne (koder ViT i aligner) oraz dalsze trenowanie odblokowujące rozumienie obrazu.

Model działa w trybie image-text-to-text: przyjmuje obraz i tekst, a generuje tekst. Architektura opiera się na Mixture-of-Experts (256 ekspertów routowanych, 6 aktywnych na token, 1 współdzielony), mechanizmie uwagi DFlash, Hyper-Connections oraz ścieżce DSpark (dekodowanie spekulatywne). Wagi są kwantyzowane do FP8, a okno kontekstowe sięga 1 048 576 tokenów (skalowanie YaRN).

Wobec DeepSeek-V4-Flash-0731 model osiąga wyraźną poprawę w multimodalnych zadaniach agentowych przy zachowaniu porównywalnej jakości w zadaniach tekstowych. Wagi udostępniono na Hugging Face na licencji MIT; model można uruchomić lokalnie przez vLLM lub SGLang.

Klasyfikacja
Model multimodalnyModel wzrokowyModel rozumowania
Rodzina: DeepSeek
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 1M
Narzędzia
📥 Wejście: obraz, tekst

Specyfikacja techniczna

Okno kontekstowe
1M
tokenów
Licencja
MIT
Wymagania sprzętowe
Uruchamiany przez vLLM lub SGLang; przykładowa konfiguracja: pojedynczy węzeł 4×GB300 (tensor-parallel-size 4), kwantyzacja FP8/FP4.
Funkcje:Używanie narzędzi
Modalności
⬇ Wejście (Input)
imagetext
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Rozumienie wykresów
Odczyt i interpretacja wykresów, tabel i diagramów.
Kategoria: vision
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Kodowanie agentowe
Wielogodzinne, wieloetapowe zadania programistyczne wykonywane samodzielnie przez model: klonowanie repozytorium, uruchamianie testów, iteracja poprawek, integracja z narzędziami CLI. Charakterystyczne dla wariantów Codex (GPT-5.1-Codex-Mini, Codex-Max).
Kategoria: coding
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Enkoder wizyjny
Zdolność modelu do kodowania obrazów i klatek wideo w gęste reprezentacje (embeddingi), wykorzystywane do dalszych zadań lub jako backbone dla modeli wizyjno-językowych.
Kategoria: vision

Wyniki benchmarków

11 benchmarków
Terminal Bench 2.1
DeepSeek Harness minimal mode, max reasoning effort, temperature=1.0, top_p=0.95
83.9
📄 technical_report
NL2Repo
57.7
📄 technical_report
Cybergym
75.3
📄 technical_report
DeepSWE
59.3
📄 technical_report
Toolathlon-Verified
75.9
📄 technical_report
DSBench-Hard
63.6
📄 technical_report
AutomationBench (Public)
25.7
📄 technical_report
ApexBench
Pass@1
36.5
📄 technical_report
Agents' Last Exam
27.3
📄 technical_report
Chartography
64.3
📄 technical_report
ZeroBench
Pass@5
35.0
📄 technical_report

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)