1) Model wizja-jezyk interpretuje polecenie i scene, ustalajac cel zadania (CO zrobic). 2) Planista/orkiestrator rozklada zadanie na sekwencje umiejetnosci i pobiera odpowiednie, zweryfikowane umiejetnosci z biblioteki. 3) Kazda umiejetnosc (skill) wykonuje konkretna, powtarzalna czynnosc (JAK), czesto wczesniej przetestowana w symulacji i rzeczywistosci. 4) Wyniki umiejetnosci sa monitorowane (mierzalnosc), a orkiestrator koryguje/kontynuuje plan az do ukonczenia zadania.
Modele end-to-end VLA bywaja nieprzewidywalne, trudne do walidacji i podatne na bledy poza rozkladem. VLS zwieksza niezawodnosc, powtarzalnosc i testowalnosc, opierajac wykonanie na wczesniej zweryfikowanych umiejetnosciach.
Interpretuje scene i polecenie jezykowe, ustalajac cel zadania (CO zrobic).
Oficjalna
Zbior wczesniej zweryfikowanych, powtarzalnych umiejetnosci (skills) realizujacych konkretne czynnosci (JAK).
Oficjalna
Rozklada zadanie na umiejetnosci, pobiera je z biblioteki, komponuje w sekwencje i monitoruje wykonanie.
Oficjalna
Zadania wymagajace umiejetnosci spoza biblioteki sa niewykonalne; pokrycie dlugiego ogona jest trudne.
Bledny dobor lub kolejnosc umiejetnosci psuje zadanie mimo poprawnych pojedynczych umiejetnosci.
Kazda umiejetnosc wymaga walidacji (sim + real) i utrzymania, co skaluje sie kosztownie.
Modele Vision-Language-Action (np. RT-2) ustanawiaja monolityczne, end-to-end podejscie do sterowania robotem, wobec ktorego VLS sie odroznia.
Holiday Robotics promuje architekture Vision-Language-Skill dla humanoida FRIDAY jako modularna, zweryfikowana alternatywe dla end-to-end VLA (Series A 105 mln USD).
Złożoność czasowa: Zalezna od VLM (planowanie) + wybor/wykonanie umiejetnosci. Złożoność przestrzenna: O(VLM + biblioteka umiejetnosci).
Skutecznosc VLS zalezy od pokrycia zadan przez zweryfikowane umiejetnosci; luki w bibliotece (dlugi ogon) oraz bledy orkiestracji ograniczaja elastycznosc wzgledem end-to-end VLA. Walidacja umiejetnosci (sim + real) jest kosztowna.
Jak drobne/zlozone sa pojedyncze umiejetnosci.
Liczba i pokrycie zweryfikowanych umiejetnosci.
Jak zadanie jest rozkladane i komponowane z umiejetnosci (planowanie, LLM, reguly).
Wybor umiejetnosci zalezy od zadania i sceny.
Orkiestrator warunkowo wybiera umiejetnosci z biblioteki dla danego zadania.
Planowanie VLM i wybor umiejetnosci mozna zrownoleglic; wykonanie w zadaniu jest sekwencyjne.
Warstwa wizja-jezyk (planowanie) korzysta z akceleratorow GPU; wykonanie umiejetnosci moze dzialac na sterownikach/edge robota.