Robocikowo>ROBOCIKOWO
Trening

RFI

2026BadawczyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
Technika po-treningu polityk VLA (metoda LIFT), która wstrzykuje reaktywne sygnały siły/kontaktu, aby model radził sobie w manipulacji kontaktowej.
Kluczowa innowacja
Dodaje reaktywność na kontakt do wytrenowanej wcześniej polityki VLA na etapie po-treningu, doszczepiając równoległego eksperta akcji sterowanego siłą i inicjalizowanego zerowym residualem, co zachowuje pełną wiedzę manipulacyjną modelu bazowego.
Kategoria
Trening
Poziom abstrakcji
Wzorzec
Poziom operacji
Po-treningTreningSterowanie robotem
Zastosowania
Manipulacja kontaktowa (contact-rich)Składanie tkanin (np. ręczników)Wkładanie książek na półkęUmieszczanie pierścieni (wieża Hanoi)Po-trening polityk VLA sterowanych obrazemSterowanie robotem z czujnikiem siły 6D

Jak działa

RFI realizowana jest przez trzy główne wybory architektoniczne. (1) Podwójni eksperci akcji: obok oryginalnego eksperta akcji doszczepiany jest reaktywny ekspert, który dekoduje akcje przyczynowo w obrębie chunku i przyjmuje najnowsze dane o sile 6D końcówki roboczej. (2) Przyczynowa pamięć siły: sygnały siły trafiają przez „causal force memory" i cross-attention inicjalizowany zerem, dzięki czemu historia siły jest uwzględniana bez modyfikowania początkowego wyjścia akcji; pamięć jest „opóźnieniowo zsynchronizowana" ze stanem robota. (3) Odświeżanie w obrębie chunku: wolny prefiks wizyjno-językowy jest liczony raz i cache'owany, a każde odświeżenie ponownie koduje najnowszą historię siły bez pełnego przejścia przez moduł wizyjno-językowy. Zachowanie priorów zapewnia inicjalizacja: ekspert reaktywny kopiuje wagi oryginalnego eksperta i używa „przesuniętej uwagi przyczynowej", więc przed po-treningiem residual siły jest dokładnie zerowy i model startuje z tym samym wyjściem co bazowy VLA. Trening używa addytywnej funkcji celu flow-matching, która wspólnie nadzoruje oba strumienie: batche czysto wizyjne maskują pamięć siły, a batche korekt online ją aktywują (stały stosunek offline:online = 1:1). Powtarzana pętla online DAgger zbiera korekty ludzkie z włączoną siłą (przez Flexiv TDK) i miesza je z danymi offline, adresując przesunięcie dystrybucji zależne od polityki.

Rozwiązany problem

Wytrenowane polityki VLA są w dużej mierze sterowane obrazem i zawodzą w manipulacji kontaktowej (contact-rich), gdy scena jest zasłonięta, głębia niejednoznaczna, a niewielkie błędy siły wypychają wykonanie poza dystrybucję demonstracji offline. Siła ujawnia stany kontaktu, których sam obraz nie widzi (czy tkanina została chwycona, czy książka doszła do oporu, czy pierścień się zakleszczył). RFI dodaje tę reaktywność bez utraty wiedzy modelu bazowego.

Komponenty

Reactive Action Expert (Dual Action Experts)Reaktywny strumień akcji sterowany siłą

Drugi ekspert akcji doszczepiony obok oryginalnego eksperta bazowej polityki VLA. Dekoduje akcje przyczynowo w obrębie chunku akcji i przyjmuje najnowsze dane o sile 6D końcówki roboczej, tworząc równoległy, reaktywny strumień bez zastępowania polityki bazowej.

Causal Force Memory (zero-initialized cross attention)Wprowadzenie historii siły

Kanał, którym sygnały siły trafiają do polityki przez cross-attention inicjalizowany zerem. Pozwala uwzględniać historię siły bez modyfikowania początkowego wyjścia akcji i dostarcza pamięć siły opóźnieniowo zsynchronizowaną z rzeczywistym stanem robota.

Zero-Initialized Residual / Prior PreservationZachowanie priorów modelu bazowego

Mechanizm inicjalizacji: ekspert reaktywny kopiuje wagi oryginalnego eksperta akcji i używa przesuniętej uwagi przyczynowej, tak że siła jest dodawana jako residual inicjalizowany zerem. Przed po-treningiem residual siły jest dokładnie zerowy, więc rozszerzony model startuje z tym samym wyjściem akcji co bazowy VLA.

Within-Chunk RefreshReaktywność przy niskim opóźnieniu

Podczas wykonania wolny prefiks wizyjno-językowy jest liczony raz i cache'owany. Każde odświeżenie w obrębie chunku ponownie koduje najnowszą, opóźnieniowo zsynchronizowaną historię siły bez pełnego przejścia przez moduł wizyjno-językowy.

Additive Flow-Matching Objective (Heterogeneous Data Training)Wspólny cel treningowy

Addytywna funkcja celu typu flow-matching wspólnie nadzoruje strumień bazowy i reaktywny. Batche czysto wizyjne maskują pamięć siły, a batche korekt online ją aktywują, dzięki czemu jeden model trenuje na obu typach danych bez syntetycznych etykiet; stały stosunek próbkowania offline:online wynosi 1:1.

Online DAgger LoopKorekta przesunięcia dystrybucji

Powtarzana pętla online DAgger zbiera korekty ludzkie z włączoną siłą (przez Flexiv TDK) i miesza je z danymi offline, aby zaadresować przesunięcie dystrybucji zależne od polityki.

Oficjalna

Implementacja

Pułapki implementacyjne
Utrata priorów modelu bazowego przy dodawaniu siłyWysoka

Naiwne dołożenie ścieżki siły może zaburzyć wyjście wytrenowanej polityki VLA i skasować jej ogólną wiedzę manipulacyjną.

Rozwiązanie:Inicjalizacja siły jako residualu zerowego (kopiowanie wag eksperta + przesunięta uwaga przyczynowa), tak że model startuje z identycznym wyjściem co bazowy VLA.
Niedopasowanie opóźnienia pamięci siłyWysoka

Jeśli historia siły nie jest zsynchronizowana z rzeczywistym stanem robota, reaktywne akcje odnoszą się do nieaktualnego kontaktu.

Rozwiązanie:Zastosowanie opóźnieniowo zsynchronizowanej pamięci siły i odświeżania w obrębie chunku ponownie kodującego najnowszą historię siły.
Przesunięcie dystrybucji zależne od politykiŚrednia

Drobne błędy siły wypychają wykonanie poza dystrybucję demonstracji offline, czego same dane offline nie pokrywają.

Rozwiązanie:Powtarzana pętla online DAgger zbierająca korekty ludzkie z włączoną siłą i mieszająca je z danymi offline (stosunek 1:1).

Ewolucja

Oryginalny paper · 2026 · CoRL 2026 · Yi Wang
Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection
Yi Wang, Wendi Chen, Zimo Wen, Han Xue, Xueqi Li, Wenye Yu, Zhijie Chen, Hao Yang, Jun Lv, Chuan Wen, Cewu Lu
2026
Wprowadzenie RFI w metodzie LIFT
Punkt przełomowy

Praca „Never Too Late for Force" (arXiv:2607.14236, CoRL 2026) wprowadza Reactive Force Injection jako rdzeń frameworka LIFT do po-treningu polityk VLA z reaktywnością na kontakt.

Hiperparametry (konfigurowalne osie)

Stosunek próbkowania offline:onlineWysoka

Proporcja mieszania danych offline i korekt online w trakcie po-treningu. W pracy użyto stałej wartości 1:1.

1:1Wartość użyta w pracy; przewyższała trening wyłącznie online na składaniu tkanin.
Długość pamięci siły (opóźnieniowo zsynchronizowana)Wysoka

Zakres historii siły 6D podawanej reaktywnemu ekspertowi przez przyczynową pamięć siły; musi być opóźnieniowo zsynchronizowany ze stanem robota.

Rozmiar chunku akcjiŚrednia

Liczba akcji dekodowanych w jednym chunku; określa jak często następuje odświeżanie w obrębie chunku z aktualną historią siły.

Paradygmat wykonania

Wzorzec aktywacji
Zależne od wejścia
Mechanizm routingu

Równoległość

Poziom równoległości
Częściowo równoległy

Wolny prefiks wizyjno-językowy jest liczony raz i cache'owany, a szybkie odświeżenia siły w obrębie chunku biegną bez pełnego przejścia przez moduł wizyjno-językowy.

Zakres
Inferencja