Robocikowo>ROBOCIKOWO
Qwen3.5-0.8B

Qwen3.5-0.8B

3.5 · 0.8B · Rodzina: Qwen3
Kompaktowy (0,8B) multimodalny model Qwen (Alibaba): hybryda Gated DeltaNet + rzadki MoE, 24 warstwy, kontekst 262K, tekst/obraz/wideo, tryb myślenia i narzędzia. Apache 2.0.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel multimodalnyLLMModel rozumowania📁 Qwen3
Okno kontekstowe
262K
tokenów
Parametry
0.8B
parametrów
Data premiery
1 stycznia 2026
Dostęp:DownloadHostedWdrożenie:💻 Lokalnie☁ Cloud📱 Na urządzeniu

Przegląd

Qwen3.5-0.8B to kompaktowy, przyczynowy model językowo-wizyjny o 0,8 mld parametrów z rodziny Qwen (Alibaba). Ma 24 warstwy i architekturę hybrydową łączącą Gated DeltaNet z rzadkim Mixture-of-Experts (MoE), zoptymalizowaną pod wydajną inferencję.

Model jest multimodalny — przyjmuje tekst, obrazy i wideo — oraz obsługuje natywny kontekst do 262 144 tokenów. Domyślnie działa w trybie „non-thinking”, ale tryb rozumowania (thinking) można włączyć przez parametry API; wspiera też wywoływanie narzędzi i zastosowania agentowe.

Qwen3.5-0.8B przeszedł zarówno pretrening, jak i post-training, celując w wysoką użyteczność w rozumowaniu, kodowaniu i rozumieniu wizualnym. Jako najmniejszy wariant serii wypada skromniej od większych modeli 2B/4B, ale pozostaje bardzo lekki. Udostępniony na licencji Apache 2.0 (do zastosowań badawczych i komercyjnych).

Klasyfikacja
Model multimodalnyLLMModel rozumowania
Rodzina: Qwen3
Dostęp i wdrożenie
PobieranieHostowane
LokalnieChmuraNa urządzeniu
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 262K
🧩 Parametry: 0.8B
Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst, obraz, wideo

Specyfikacja techniczna

Okno kontekstowe
262K
tokenów
Parametry
0.8B
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
24 warstwy, hybryda Gated DeltaNet + rzadki MoE; natywny kontekst 262 144 tokenów. Bardzo lekki, do wydajnej inferencji.
Funkcje:Używanie narzędziFine-tuning
Modalności
⬇ Wejście (Input)
textimagevideo
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning

Architektura techniczna

Rdzeń architektury (Core Architecture)