Robocikowo>ROBOCIKOWO
QwenVL3.5-4B

QwenVL3.5-4B

QwenVL3.5-4B (wariant Qwen3.5-VL ~4B) · Rodzina: Qwen
Wizualno-językowy model klasy 4B z rodziny Qwen3.5-VL (Alibaba), znany przede wszystkim jako backbone warstwy planującej w modelu bazowym Psi-R2.5 od PsiBot.
✓ Aktywny⏳ Ograniczony dostęp⚖ Open weightsModel wzrokowyModel multimodalnyLLM📁 Qwen
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

QwenVL3.5-4B to wizualno-językowy model klasy 4 mld parametrów z rodziny Qwen3.5-VL rozwijanej przez Alibabę. Pod tą nazwą występuje przede wszystkim w dokumentacji technicznej chińskiej firmy PsiBot, która wykorzystała go jako backbone warstwy górnej (planującej) w modelu bazowym embodied AI Psi-R2.5, zaprezentowanym we wrześniu 2026 roku.

W tej roli model przetwarza instrukcje wizualno-językowe i rozkłada je na podzadania, korzystając z kontekstu metadanych — pamięci i miękkich promptów — oraz z sygnałów wartości pochodzących z uczenia ze wzmocnieniem. Wynik jego pracy trafia do warstwy dolnej opartej na Wan2.2-TI2V-5B, która zamienia plan na trajektorie akcji robota. PsiBot deklaruje, że obie warstwy korzystają z własnych, firmowych danych pretreningowych.

Uwaga o nazewnictwie: rodzina Qwen3.5-VL istnieje i jest publikowana przez Alibabę w 2026 roku w kilku rozmiarach (m.in. checkpointy 2B, 9B i 122B-A10B, przy czym wersja 9B posłużyła jako podstawa modelu Qwen-Image-2.1). Alibaba nie opublikowała jednak oficjalnej karty modelu pod dokładną nazwą „QwenVL3.5-4B" — ta forma zapisu pochodzi z materiałów PsiBot i to one pozostają jedynym bezpośrednim źródłem dla wariantu 4B używanego w Psi-R2.5. Dokładna liczba parametrów, okno kontekstu i licencja tego konkretnego checkpointu nie zostały podane publicznie.

Klasyfikacja
Model wzrokowyModel multimodalnyLLM
Rodzina: Qwen
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
📥 Wejście: tekst, obraz, wideo

Specyfikacja techniczna

Modalności
⬇ Wejście (Input)
textimagevideo
⬆ Wyjście (Output)
textstructured_data

Możliwości i zastosowania

Natywne możliwości modelu
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Enkoder wizyjny
Zdolność modelu do kodowania obrazów i klatek wideo w gęste reprezentacje (embeddingi), wykorzystywane do dalszych zadań lub jako backbone dla modeli wizyjno-językowych.
Kategoria: vision