Dla danej instrukcji i obrazu model VLA generuje najpierw tekstowy łańcuch rozumowania: rozumowanie wysokopoziomowe (zrozumienie zadania → plan → podzadanie) oraz uziemienie niskopoziomowe (opis ruchu → pozycja chwytaka → ramki ograniczające obiektów). Dopiero po wygenerowaniu tych kroków model przewiduje kolejną akcję robota. Dane treningowe powstają w potoku, który wykorzystuje modele fundamentowe (detektory obiektów, VLM, LLM) do automatycznego adnotowania demonstracji Bridge V2 łańcuchami rozumowania. Model bazowy (OpenVLA, oparty na VLM Prismatic) jest następnie dostrajany do generowania rozumowania i akcji.
Modele VLA często słabo generalizują i działają jak „czarna skrzynka”, mapując obserwację na akcję bez jawnego rozumowania. ECoT wprowadza jawny, ugruntowany w percepcji łańcuch rozumowania, co poprawia generalizację (o 28 punktów procentowych bezwzględnie względem OpenVLA na trudnych zadaniach) i czyni działanie polityki interpretowalnym oraz korygowalnym w języku naturalnym — bez dodatkowych danych robotycznych.
Zrozumienie zadania, opracowanie planu i dekompozycja na podzadania.
Opis ruchu i pozycji chwytaka wiążący rozumowanie z konkretną akcją.
Ramki ograniczające obiektów i pozycja końcówki roboczej zapewniające świadomość percepcyjną.
Model VLA przewidujący akcję robota po wygenerowaniu łańcucha rozumowania.
Automatyczne adnotowanie demonstracji Bridge V2 łańcuchami rozumowania z użyciem modeli fundamentowych.
Generowanie długiego łańcucha rozumowania przed akcją spowalnia sterowanie w czasie rzeczywistym.
Syntetyczne łańcuchy rozumowania generowane przez modele fundamentowe mogą zawierać błędy przenoszone do polityki.
Nieprawidłowe bounding boxy lub pozycja chwytaka mogą prowadzić do błędnych akcji.
Wprowadzenie łańcucha myśli dla modeli językowych — koncepcyjny prekursor ECoT.
Otwarty model VLA stanowiący model bazowy dla ECoT.
Praca „Robotic Control via Embodied Chain-of-Thought Reasoning”; +28 p.p. sukcesu względem OpenVLA.
Wygenerowanie długiego łańcucha tokenów rozumowania przed każdą akcją zwiększa opóźnienie inferencji względem bezpośredniej polityki VLA.
Które kroki wchodzą w skład łańcucha: zadanie, plan, podzadanie, ruch, pozycja chwytaka, bounding boxy.
Model VLA, na którym budowane jest rozumowanie (w oryginalnej pracy OpenVLA).
Model bazowy VLA (OpenVLA / Prismatic) jest gęstym transformerem; ECoT nie zmienia trybu wykonania, dodaje jawny etap rozumowania.
Łańcuch rozumowania jest generowany autoregresyjnie token po tokenie, co jest z natury sekwencyjne i wydłuża czas do wykonania akcji.
Model VLA (rzędu miliardów parametrów) wymaga akceleracji GPU do treningu i inferencji w czasie zbliżonym do rzeczywistego.