RFI
Jak działa
RFI realizowana jest przez trzy główne wybory architektoniczne. (1) Podwójni eksperci akcji: obok oryginalnego eksperta akcji doszczepiany jest reaktywny ekspert, który dekoduje akcje przyczynowo w obrębie chunku i przyjmuje najnowsze dane o sile 6D końcówki roboczej. (2) Przyczynowa pamięć siły: sygnały siły trafiają przez „causal force memory" i cross-attention inicjalizowany zerem, dzięki czemu historia siły jest uwzględniana bez modyfikowania początkowego wyjścia akcji; pamięć jest „opóźnieniowo zsynchronizowana" ze stanem robota. (3) Odświeżanie w obrębie chunku: wolny prefiks wizyjno-językowy jest liczony raz i cache'owany, a każde odświeżenie ponownie koduje najnowszą historię siły bez pełnego przejścia przez moduł wizyjno-językowy. Zachowanie priorów zapewnia inicjalizacja: ekspert reaktywny kopiuje wagi oryginalnego eksperta i używa „przesuniętej uwagi przyczynowej", więc przed po-treningiem residual siły jest dokładnie zerowy i model startuje z tym samym wyjściem co bazowy VLA. Trening używa addytywnej funkcji celu flow-matching, która wspólnie nadzoruje oba strumienie: batche czysto wizyjne maskują pamięć siły, a batche korekt online ją aktywują (stały stosunek offline:online = 1:1). Powtarzana pętla online DAgger zbiera korekty ludzkie z włączoną siłą (przez Flexiv TDK) i miesza je z danymi offline, adresując przesunięcie dystrybucji zależne od polityki.
Rozwiązany problem
Wytrenowane polityki VLA są w dużej mierze sterowane obrazem i zawodzą w manipulacji kontaktowej (contact-rich), gdy scena jest zasłonięta, głębia niejednoznaczna, a niewielkie błędy siły wypychają wykonanie poza dystrybucję demonstracji offline. Siła ujawnia stany kontaktu, których sam obraz nie widzi (czy tkanina została chwycona, czy książka doszła do oporu, czy pierścień się zakleszczył). RFI dodaje tę reaktywność bez utraty wiedzy modelu bazowego.
Komponenty
Drugi ekspert akcji doszczepiony obok oryginalnego eksperta bazowej polityki VLA. Dekoduje akcje przyczynowo w obrębie chunku akcji i przyjmuje najnowsze dane o sile 6D końcówki roboczej, tworząc równoległy, reaktywny strumień bez zastępowania polityki bazowej.
Kanał, którym sygnały siły trafiają do polityki przez cross-attention inicjalizowany zerem. Pozwala uwzględniać historię siły bez modyfikowania początkowego wyjścia akcji i dostarcza pamięć siły opóźnieniowo zsynchronizowaną z rzeczywistym stanem robota.
Mechanizm inicjalizacji: ekspert reaktywny kopiuje wagi oryginalnego eksperta akcji i używa przesuniętej uwagi przyczynowej, tak że siła jest dodawana jako residual inicjalizowany zerem. Przed po-treningiem residual siły jest dokładnie zerowy, więc rozszerzony model startuje z tym samym wyjściem akcji co bazowy VLA.
Podczas wykonania wolny prefiks wizyjno-językowy jest liczony raz i cache'owany. Każde odświeżenie w obrębie chunku ponownie koduje najnowszą, opóźnieniowo zsynchronizowaną historię siły bez pełnego przejścia przez moduł wizyjno-językowy.
Addytywna funkcja celu typu flow-matching wspólnie nadzoruje strumień bazowy i reaktywny. Batche czysto wizyjne maskują pamięć siły, a batche korekt online ją aktywują, dzięki czemu jeden model trenuje na obu typach danych bez syntetycznych etykiet; stały stosunek próbkowania offline:online wynosi 1:1.
Powtarzana pętla online DAgger zbiera korekty ludzkie z włączoną siłą (przez Flexiv TDK) i miesza je z danymi offline, aby zaadresować przesunięcie dystrybucji zależne od polityki.
Oficjalna
Implementacja
Naiwne dołożenie ścieżki siły może zaburzyć wyjście wytrenowanej polityki VLA i skasować jej ogólną wiedzę manipulacyjną.
Jeśli historia siły nie jest zsynchronizowana z rzeczywistym stanem robota, reaktywne akcje odnoszą się do nieaktualnego kontaktu.
Drobne błędy siły wypychają wykonanie poza dystrybucję demonstracji offline, czego same dane offline nie pokrywają.
Ewolucja
Praca „Never Too Late for Force" (arXiv:2607.14236, CoRL 2026) wprowadza Reactive Force Injection jako rdzeń frameworka LIFT do po-treningu polityk VLA z reaktywnością na kontakt.
Hiperparametry (konfigurowalne osie)
Proporcja mieszania danych offline i korekt online w trakcie po-treningu. W pracy użyto stałej wartości 1:1.
Zakres historii siły 6D podawanej reaktywnemu ekspertowi przez przyczynową pamięć siły; musi być opóźnieniowo zsynchronizowany ze stanem robota.
Liczba akcji dekodowanych w jednym chunku; określa jak często następuje odświeżanie w obrębie chunku z aktualną historią siły.
Paradygmat wykonania
Równoległość
Wolny prefiks wizyjno-językowy jest liczony raz i cache'owany, a szybkie odświeżenia siły w obrębie chunku biegną bez pełnego przejścia przez moduł wizyjno-językowy.