Alibaba wydała 16 sierpnia 2026 Qwen 3.8 27B — otwarty, multimodalny model językowy na licencji Apache 2. Simon Willison ocenił go jako bardzo dobry, ale ostrzega: domyślnie model ustawia najwyższy poziom rozumowania i marnuje moc obliczeniową nawet na trywialne polecenia.
Najważniejsze w skrócie
- Qwen 3.8 27B: 27 mld parametrów, multimodalny, licencja Apache 2.
- Domyślny poziom rozumowania to „xhigh” — zdaniem Willisona zły wybór dla sprzętu konsumenckiego.
- Parametr reasoning_effort ma trzy poziomy: low, medium, xhigh.
- Okno kontekstu do 262 144 tokenów.
- Optymalizacja Multi-Token Prediction daje ok. 72% przyspieszenia.
Za dużo myślenia z automatu
Największym zaskoczeniem nie jest jakość, lecz domyślne ustawienie. Model startuje z reasoning_effort na „xhigh”, więc nawet proste polecenie potrafi wywołać długi wywód. Willison opisuje, jak prośba „narysuj SVG koła” uruchomiła rozbudowane rozważania o estetyce i skończyła się animowanym kołem zamiast zwykłego. Nazywa ten domyślny tryb „przezabawnym” i wprost odradza go na sprzęcie konsumenckim.
Zignorujcie ten domyślny tryb. Uruchamiajcie Qwen 3.8 27B najpierw na niskim lub zerowym poziomie rozumowania.
Simon Willison.
| Poziom | Kiedy używać |
|---|---|
| low | proste zadania, minimum zużycia |
| medium | zbalansowany kompromis |
| xhigh | domyślny — maksimum rozumowania, wysoki koszt |
Jak to uruchomić i dla kogo
Model waży około 17 GB w kwantyzacji Q4_K_M, co mieści się na mocniejszych laptopach. Willison testował go na MacBooku Pro M5 Max (128 GB) i na NVIDIA DGX Spark, używając LM Studio i llama-server. Prędkość to 15–30 tokenów na sekundę — wolniej niż hostowane API, ale wystarczająco do pracy lokalnej. Pokazał generowanie SVG, wykrywanie ramek (bounding boxów), kod HTML i Python oraz pracę jako agent kodujący.
Okno kontekstu sięga 262 144 tokenów, a wbudowana optymalizacja Multi-Token Prediction daje około 72% przyspieszenia.
on DGX Spark: llama serve \ -hf ggml-org/Qwen3.8-27B-GGUF:Q4_K_M \ -hfd ggml-org/Qwen3.8-27B-GGUF:Q4_0 \ --spec-default \ --spec-type draft-mtp \ --reasoning-preserve --agent
Dlaczego to ważne?
Otwarty model 27B, który mieści się na jednym mocnym laptopie i radzi sobie z kodem oraz obrazem, obniża próg wejścia dla lokalnego AI.
Ale historia z domyślnym „xhigh” pokazuje szerszy problem: producenci coraz częściej ustawiają maksymalne rozumowanie jako domyślne, co podbija koszty i opóźnienia bez pytania użytkownika. Świadome zarządzanie budżetem rozumowania staje się realną umiejętnością, a nie detalem — zwłaszcza gdy model działa lokalnie i płacisz własnym prądem i czasem.
Co dalej?
- Użytkownicy lokalni powinni jawnie ustawiać reasoning_effort na low/medium, by uniknąć marnowania mocy — wg zaleceń Willisona.
- Otwarta licencja Apache 2 pozwala na komercyjne wdrożenia i dostrajanie bez ograniczeń licencyjnych.
- Realnym testem będzie porównanie Qwen 3.8 27B z innymi otwartymi modelami tej klasy na zadaniach kodujących.
Źródła
- Simon Willison's Weblog — Qwen 3.8 27B is excellent, but it defaults to wildly overthinking things
- Hugging Face — Qwen (organizacja, karty modeli)





