Robocikowo>ROBOCIKOWO
LI

LingBot-VLA

4B / 6B
Fundamentowy model wizja-język-akcja (4B/6B) do sterowania robotami, wytrenowany na 20 000 godzin rzeczywistych danych z 9 konfiguracji robotów dwuramiennych.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel wzrok-język-akcjaBazowy model robotyczny
Parametry
4B / 6B
parametrów
Data premiery
1 stycznia 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie

Przegląd

LingBot-VLA to fundamentowy model wizja-język-akcja (VLA) przeznaczony do sterowania robotami. Dostępny jest w wariantach 4B i 6B parametrów (oraz wersji LingBot-VLA-4B-Depth z czujnikiem głębi), zbudowany na bazie projektu VeOmni.

Model wyróżnia praktyczne podejście do danych: wstępny trening objął 20 000 godzin rzeczywistych danych zebranych z 9 popularnych konfiguracji robotów dwuramiennych. Integruje modalności wizyjną, językową i akcyjną, mapując obserwacje i polecenia na działania robota.

Twórcy raportują wyraźną przewagę nad konkurencyjnymi modelami na benchmarkach symulacyjnych i rzeczywistych oraz przyspieszenie treningu rzędu 1,5–2,8× względem istniejących bibliotek VLA (zależnie od bazowego modelu wizyjno-językowego). Wagi udostępniono na licencji Apache 2.0.

Klasyfikacja
Model wzrok-język-akcjaBazowy model robotyczny
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 4B / 6B
✓ Fine-tuning
📥 Wejście: obraz, tekst, głębia, dane stanu robota

Specyfikacja techniczna

Parametry
4B / 6B
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Warianty 4B i 6B (safetensors). Bazuje na frameworku VeOmni; trening do 1,5–2,8× szybszy niż typowe biblioteki VLA.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
imagetextdepthrobot_state_data
⬆ Wyjście (Output)
robot_actionsmotion_trajectories

Możliwości i zastosowania

Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding

Wyniki benchmarków

2 benchmarki
RoboTwin
post-training / manipulacja dwuramienna
📄 paper
Wariant LingBot-VLA-4B-posttrain-robotwin; przewaga nad konkurencją wg publikacji.
Benchmarki rzeczywiste (real-world)
📄 paper
Wyraźna przewaga na benchmarkach rzeczywistych wg twórców (2026).

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)