Robocikowo>ROBOCIKOWO
UBTECH Thinker-VLA

UBTECH Thinker-VLA

Thinker-VLA 1.0 · Rodzina: Thinker
Model wizja-język-akcja z rodziny UBTECH Thinker: łączy percepcję wizualną, polecenia językowe i generowanie działań. Zastosowany w przemysłowych zadaniach manipulacji.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel wzrok-język-akcja📁 Thinker
Wdrożenie:📱 Na urządzeniu☁ Cloud

Przegląd

UBTECH Thinker-VLA to model wizja-język-akcja (VLA) z rodziny Thinker firmy UBTECH Robotics. Stanowi trzecią, wykonawczą warstwę stosu Thinker: łączy percepcję wizualną, polecenia w języku naturalnym oraz generowanie działań, dostosowując ruchy robota do zmieniających się obiektów i otoczenia.

Zastosowania i wydajność

Model wykorzystywany jest w przemysłowych zadaniach przenoszenia i załadunku. Według UBTECH podnosi efektywność wnioskowania w scenariuszach przemysłowych o 176%. Szczegóły architektury, liczby parametrów i licencji nie zostały publicznie ujawnione.

Klasyfikacja
Model wzrok-język-akcja
Rodzina: Thinker
Dostęp i wdrożenie
Na urządzeniuChmura
Wagi: Open source
Kluczowe parametry
📥 Wejście: obraz, tekst, sensory robota
Robotyka
Robot manipulationRobot controlVisual groundingObject affordance understandingMotion planning

Specyfikacja techniczna

Licencja
Open source (deklaracja UBTECH; brak potwierdzonego publicznego repozytorium)
Wymagania sprzętowe
Nieujawnione publicznie. Model wykonawczy VLA w warstwie akcji humanoidów UBTECH (wnioskowanie na urządzeniu i w chmurze).
Modalności
⬇ Wejście (Input)
imagetextrobot_sensors
⬆ Wyjście (Output)
robot_actionsmanipulator_controlmotion_trajectories

Możliwości i zastosowania

Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Robotyka
Robot manipulationRobot controlVisual groundingObject affordance understandingMotion planning

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)