DeepSeek porzucił symetryczny stos warstw, na którym opierał V4-Flash, i wypuścił V4.1-Flash z architekturą Causal Encoder-Decoder. Model z 552 mld parametrów w szkielecie aktywuje tylko 8 mld przy czytaniu wejścia i 16 mld przy generowaniu odpowiedzi. Cel jest jeden: obciążenia agentowe, w których wejście liczy dziesiątki tysięcy tokenów, a odpowiedź jest krótka.
Najważniejsze w skrócie
- 552 mld parametrów w szkielecie, wzrost o 94 procent wobec 284 mld w V4-Flash.
- 40 warstw podzielonych na 20 warstw enkodera i 20 warstw dekodera — układ niesymetryczny.
- Globalny KV cache skompresowany do 890 bajtów na token, czyli około jednej czwartej tego, co w poprzedniku.
- Okno kontekstu 1 mln tokenów, wagi otwarte na licencji MIT.
- Cena poza szczytem: 0,15 USD za mln tokenów wejścia i 0,60 USD za mln wyjścia (ok. 2,40 zł).
Asymetria zamiast jednolitego stosu
Klasyczny LLM przepuszcza wejście i wyjście przez ten sam stos warstw. CED rozdziela te role: 20 warstw czyta i przetwarza wejście, 20 kolejnych generuje odpowiedź. Stąd rozjazd w aktywacjach — prefill?Prefill: Faza, w której model jednorazowo przetwarza całe wejście, zanim wygeneruje pierwszy token odpowiedzi. Przy długich promptach to ona zjada większość obliczeń. uruchamia 8 mld parametrów, dekodowanie 16 mld. Do szkieletu dochodzi 196 mld parametrów w rzadko odpytywanych modułach pamięci warunkowej Engram.
Parametry, które odróżniają V4.1-Flash od poprzednika:
890 bajtów na token
Druga zmiana dotyczy pamięci podręcznej uwagi. CSA2, czyli druga generacja Compressed Sparse Attention, korzysta z trzech statycznych trybów uwagi — Full, Reindex i Reuse — oraz przechowuje główny KV cache w formacie FP4 (E2M1). Efekt: 890 bajtów na token zamiast około czterokrotnie większej wartości w V4-Flash.
Znaczenie symboli
- …
- łączny rozmiar globalnego KV cache dla jednej sekwencji
- …
- rozmiar cache przypadający na token — 890 bajtów w V4.1-Flash
- …
- długość kontekstu w tokenach — tutaj pełne okno 1 mln
Wyniki blisko czołówki, cena znacznie niżej
Na agentowym DeepSWE v1.1 model osiąga 74,2 punktu — minimalnie przed Claude Opus 5 i GPT-5.6 Sol. To remis w granicach błędu, ale przy cenniku, który nie należy do tej samej ligi. W rozumowaniu model notuje 90,9 punktu na GPQA Diamond. Chińskie analizy zwracają uwagę, że trening pozostał standardowy — SFT, RL i online distillation — a poprawa wyszła głównie z pipeline'u danych, nie z nowych algorytmów.
| Model | DeepSWE v1.1 | GPQA Diamond |
|---|---|---|
| DeepSeek-V4.1-Flash | 74,2 | 90,9 |
| Claude Opus 5 | 74,0 | — |
| GPT-5.6 Sol | 73,0 | — |
Dlaczego to ważne?
Rozdzielenie enkodera od dekodera to przyznanie, że workload się zmienił. Chat to krótkie wejście i długie wyjście, agent to odwrotność. Optymalizowanie obu tym samym stosem warstw przestaje się opłacać. Jeśli podejście się obroni, konkurenci będą musieli albo powtórzyć ten podział, albo tłumaczyć, dlaczego płacą za pamięć, której nie potrzebują.
Co dalej?
- Wagi są dostępne na Hugging Face na licencji MIT, więc niezależne pomiary KV i przepustowości są kwestią tygodni.
- Wyniki Terminal-Bench podawane przez DeepSeek i przez media wtórne rozjeżdżają się między wersjami benchmarku — warto poczekać na niezależne odtworzenie.
Pobranie wag z oficjalnego repozytorium sprowadza się do jednego wywołania:
from huggingface_hub import snapshot_download
snapshot_download(
repo_id="deepseek-ai/DeepSeek-V4.1-Flash",
local_dir="./DeepSeek-V4.1-Flash",
)




