Qwen udostępnił Qwen3.8-Flash-Next — model ze 125 mld parametrów, z których przy jednym zapytaniu pracuje tylko 6 mld. Firma opisuje go wprost jako wczesny podgląd architektury, która trafi do Qwen4. Model przyjmuje tekst, obraz i wideo.
Najważniejsze w skrócie
- 125 mld parametrów łącznie, 6 mld aktywnych przy jednym zapytaniu
- W tym 51 mld parametrów w osadzeniach n-gramowych i 4 mld na multi-token prediction
- Kontekst 262 144 tokenów natywnie, rozszerzalny do miliona
- Hybrydowa atencja: Gated DeltaNet w połączeniu z Qwen Sparse Attention
- Licencja qwen-community-1.0, tryb rozumowania włączony domyślnie
Atencja na mikroblokach zamiast tokenów
Qwen Sparse Attention nie wybiera pojedynczych tokenów, lecz działa na mikroblokach. To obniża opóźnienie przy długim kontekście, bo model nie musi przeglądać całej sekwencji token po tokenie.
Drugi filar to n-gram embedding. Pozwala zwiększyć liczbę parametrów bez narzutu, jaki niesie klasyczna mixture of experts — stąd 51 mld parametrów w samych embeddingach. Trening prowadzono dwoma optymalizatorami naraz, Muonem i AdamW, dobieranymi zależnie od kategorii wag.
Ze 125 mld parametrów tylko ułamek pracuje przy jednym zapytaniu:
Wyniki: agenty, kod i ekran telefonu
Najmocniejsza strona modelu to zadania agentowe. W obsłudze interfejsu Androida notuje 84,5 punktu, a w rozumieniu obrazu ze świata rzeczywistego 88,5. Wyniki na kodzie są solidne, choć nie rekordowe — 58,7 na DeepSWE 1.1 i 62,5 na SWE-bench Pro.
Zapowiedziany kontrast z siostrzanym modelem jest wyraźny. Qwen 3.8 27B, o którym pisaliśmy w zeszłym tygodniu, to model gęsty — tu przy czterokrotnie większej liczbie parametrów pracuje ich niespełna 5 proc.
Simon Willison uruchomił skwantyzowane wersje na stacji DGX Spark. Wariant 78,9 GB uznał za najlepszy kompromis, co oznacza, że model mieści się na jednej maszynie deweloperskiej.
Dlaczego to ważne?
Podgląd architektury przed premierą kolejnej generacji to rzadkość i realna informacja dla rynku. Jeśli Qwen4 rzeczywiście oprze się na rzadkiej atencji na mikroblokach i n-gram embeddingach zamiast czystego MoE, oznacza to odejście od kierunku, którym poszła większość laboratoriów. Zespoły planujące własną infrastrukturę dostają rok wyprzedzenia w decyzjach sprzętowych.
Co dalej?
- Qwen zapowiada tę architekturę jako podstawę Qwen4, bez podanej daty premiery
- Model działa na vLLM, SGLang i Transformers, więc wdrożenie nie wymaga własnego runtime'u
- Kontekst rozszerzalny do miliona tokenów pozostaje deklaracją — brak publicznych testów na tej długości
Źródła
- Simon Willison — Qwen3.8-Flash-Next
- Hugging Face — Qwen/Qwen3.8-Flash-Next





