LI
Fundamentowy model wizja-język-akcja (4B/6B) do sterowania robotami, wytrenowany na 20 000 godzin rzeczywistych danych z 9 konfiguracji robotów dwuramiennych.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel wzrok-język-akcjaBazowy model robotyczny
Parametry
4B / 6B
parametrów
Data premiery
1 stycznia 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie
Przegląd
Klasyfikacja
Model wzrok-język-akcjaBazowy model robotyczny
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 4B / 6B
✓ Fine-tuning
📥 Wejście: obraz, tekst, głębia, dane stanu robota
Specyfikacja techniczna
Parametry
4B / 6B
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Warianty 4B i 6B (safetensors). Bazuje na frameworku VeOmni; trening do 1,5–2,8× szybszy niż typowe biblioteki VLA.
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
imagetextdepthrobot_state_data
⬆ Wyjście (Output)
robot_actionsmotion_trajectories
Możliwości i zastosowania
Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Wyniki benchmarków
2 benchmarki
RoboTwin
post-training / manipulacja dwuramienna
📄 paper
Wariant LingBot-VLA-4B-posttrain-robotwin; przewaga nad konkurencją wg publikacji.
Benchmarki rzeczywiste (real-world)
📄 paper
Wyraźna przewaga na benchmarkach rzeczywistych wg twórców (2026).
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)