Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

DeepSeek V4.1-Flash: encoder-decoder i 890 bajtów KV na token

Pan Robocik19 września 2026 · 3 min czytania
DeepSeek V4.1-Flash: encoder-decoder i 890 bajtów KV na token

DeepSeek porzucił symetryczny stos warstw, na którym opierał V4-Flash, i wypuścił V4.1-Flash z architekturą Causal Encoder-Decoder. Model z 552 mld parametrów w szkielecie aktywuje tylko 8 mld przy czytaniu wejścia i 16 mld przy generowaniu odpowiedzi. Cel jest jeden: obciążenia agentowe, w których wejście liczy dziesiątki tysięcy tokenów, a odpowiedź jest krótka.

Najważniejsze w skrócie

  • 552 mld parametrów w szkielecie, wzrost o 94 procent wobec 284 mld w V4-Flash.
  • 40 warstw podzielonych na 20 warstw enkodera i 20 warstw dekodera — układ niesymetryczny.
  • Globalny KV cache skompresowany do 890 bajtów na token, czyli około jednej czwartej tego, co w poprzedniku.
  • Okno kontekstu 1 mln tokenów, wagi otwarte na licencji MIT.
  • Cena poza szczytem: 0,15 USD za mln tokenów wejścia i 0,60 USD za mln wyjścia (ok. 2,40 zł).
0,003 USDza milion tokenów wejścia z cache poza szczytem. Konkurenci o zbliżonym wyniku liczą wielokrotnie więcejDeepSeek

Asymetria zamiast jednolitego stosu

Klasyczny LLM przepuszcza wejście i wyjście przez ten sam stos warstw. CED rozdziela te role: 20 warstw czyta i przetwarza wejście, 20 kolejnych generuje odpowiedź. Stąd rozjazd w aktywacjach — Prefill: Faza, w której model jednorazowo przetwarza całe wejście, zanim wygeneruje pierwszy token odpowiedzi. Przy długich promptach to ona zjada większość obliczeń. uruchamia 8 mld parametrów, dekodowanie 16 mld. Do szkieletu dochodzi 196 mld parametrów w rzadko odpytywanych modułach pamięci warunkowej Engram.

Prefill
Wejście: dziesiątki tysięcy tokenówtypowy prompt agentowy
Enkoder — 20 warstw8 mld aktywnych parametrów
Globalny KV cache890 B/token, format FP4 (E2M1)
Dekodowanie
Dekoder — 20 warstw16 mld aktywnych parametrów
Krótka odpowiedźAllow
Uproszczony przebieg zapytania w architekturze CED. Schemat oddaje podział ról między enkoderem a dekoderem, nie pełną topologię warstw.

Parametry, które odróżniają V4.1-Flash od poprzednika:

552Bparametrów w szkielecie (było 284B)
8B / 16Baktywne przy prefill / przy dekodowaniu
20 + 20warstwy enkodera i dekodera
890 B/tokenglobalny KV cache
FP4 (E2M1)format przechowywania KV
1Mokno kontekstu w tokenach

890 bajtów na token

Druga zmiana dotyczy pamięci podręcznej uwagi. CSA2, czyli druga generacja Compressed Sparse Attention, korzysta z trzech statycznych trybów uwagi — Full, Reindex i Reuse — oraz przechowuje główny KV cache w formacie FP4 (E2M1). Efekt: 890 bajtów na token zamiast około czterokrotnie większej wartości w V4-Flash.

Przy pełnym oknie miliona tokenów daje to około 890 MB na jedną sekwencję. Poprzednik, z czterokrotnie większym cache na token, potrzebowałby w tych samych warunkach około 3,6 GB.To wartość na jedną sesję — przy wielu równoległych sekwencjach różnica mnoży się przez ich liczbę i dopiero tam decyduje o koszcie serwowania.
Znaczenie symboli
łączny rozmiar globalnego KV cache dla jednej sekwencji
rozmiar cache przypadający na token — 890 bajtów w V4.1-Flash
długość kontekstu w tokenach — tutaj pełne okno 1 mln

Wyniki blisko czołówki, cena znacznie niżej

Na agentowym DeepSWE v1.1 model osiąga 74,2 punktu — minimalnie przed Claude Opus 5 i GPT-5.6 Sol. To remis w granicach błędu, ale przy cenniku, który nie należy do tej samej ligi. W rozumowaniu model notuje 90,9 punktu na GPQA Diamond. Chińskie analizy zwracają uwagę, że trening pozostał standardowy — SFT, RL i online distillation — a poprawa wyszła głównie z pipeline'u danych, nie z nowych algorytmów.

ModelDeepSWE v1.1GPQA Diamond
DeepSeek-V4.1-Flash74,290,9
Claude Opus 574,0
GPT-5.6 Sol73,0
Wyniki podawane przez DeepSeek. Myślnik oznacza brak porównywalnej liczby w materiale źródłowym.

Dlaczego to ważne?

Rozdzielenie enkodera od dekodera to przyznanie, że workload się zmienił. Chat to krótkie wejście i długie wyjście, agent to odwrotność. Optymalizowanie obu tym samym stosem warstw przestaje się opłacać. Jeśli podejście się obroni, konkurenci będą musieli albo powtórzyć ten podział, albo tłumaczyć, dlaczego płacą za pamięć, której nie potrzebują.

Co dalej?

  • Wagi są dostępne na Hugging Face na licencji MIT, więc niezależne pomiary KV i przepustowości są kwestią tygodni.
  • Wyniki Terminal-Bench podawane przez DeepSeek i przez media wtórne rozjeżdżają się między wersjami benchmarku — warto poczekać na niezależne odtworzenie.

Pobranie wag z oficjalnego repozytorium sprowadza się do jednego wywołania:

Python
from huggingface_hub import snapshot_download

snapshot_download(
    repo_id="deepseek-ai/DeepSeek-V4.1-Flash",
    local_dir="./DeepSeek-V4.1-Flash",
)

Źródła

Udostępnij ten artykuł