Model wizja-język-akcja z rodziny UBTECH Thinker: łączy percepcję wizualną, polecenia językowe i generowanie działań. Zastosowany w przemysłowych zadaniach manipulacji.
Wdrożenie:📱 Na urządzeniu☁ Cloud
Przegląd
Zastosowania
Dostęp i wdrożenie
Na urządzeniuChmura
Wagi: Open source
Kluczowe parametry
📥 Wejście: obraz, tekst, sensory robota
Robotyka
Robot manipulationRobot controlVisual groundingObject affordance understandingMotion planning
Specyfikacja techniczna
Licencja
Open source (deklaracja UBTECH; brak potwierdzonego publicznego repozytorium)
Wymagania sprzętowe
Nieujawnione publicznie. Model wykonawczy VLA w warstwie akcji humanoidów UBTECH (wnioskowanie na urządzeniu i w chmurze).
Modalności
⬇ Wejście (Input)
imagetextrobot_sensors
⬆ Wyjście (Output)
robot_actionsmanipulator_controlmotion_trajectories
Możliwości i zastosowania
Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Robotyka
Robot manipulationRobot controlVisual groundingObject affordance understandingMotion planning
Dziedziny zastosowań
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
