Zespół Shanghai Jiao Tong University pokazał LIFT — metodę, dzięki której pretrenowana polityka VLA zaczyna reagować na siłę kontaktu, choć w pretreningu nie widziała ani jednej etykiety siły. Praca została przyjęta na CoRL 2026, a kod jest publicznie dostępny.
Najważniejsze w skrócie
- LIFT doszczepia reaktywnego eksperta akcji obok oryginalnego w pretrenowanej polityce pi-0.5
- Historia siły 6D wchodzi przez cross-attention z zerowaną projekcją — model startuje z zachowaniem bazy
- Testy na ramieniu Flexiv Rizon 4S: składanie ręcznika, wkładanie książki, pierścień Hanoi
- Ewaluacja: 30 autonomicznych przebiegów na checkpoint, 95-procentowe przedziały ufności
- Autorzy korespondencyjni: Chuan Wen i Cewu Lu, arXiv 2607.14236
Siła dopiero na końcu, prior nienaruszony
Pretrenowane polityki VLA rozumieją polecenia językowe, ale sterują niemal wyłącznie obrazem. W kontakcie to przestaje wystarczać: scena bywa zasłonięta, głębia niejednoznaczna, a drobny błąd siły wypycha wykonanie poza rozkład demonstracji.
LIFT kopiuje wagi oryginalnego eksperta akcji do nowego, reaktywnego strumienia, a ścieżkę siły podłącza przez cross-attention z zerowaną projekcją wyjściową. Przed post-treningiem residual siły jest zerowy, więc model zachowuje się identycznie jak baza.
Reaktywny strumień dekoduje akcje przyczynowo wewnątrz chunka?action chunking: Przewidywanie od razu całej krótkiej sekwencji akcji zamiast pojedynczego kroku sterowania. Chunk to taka porcja akcji., zamiast odtwarzać go w pętli otwartej, a wolny prefiks wizyjno-językowy liczony jest raz i trafia do cache'u.
Diagram pokazuje, dlaczego LIFT nie psuje bazowego modelu. Zerowana projekcja wyjściowa sprawia, że przed post-treningiem residual siły wynosi zero, a polityka zachowuje się dokładnie jak pretrenowany π0.5. Sygnał siły zaczyna wpływać na akcje dopiero wtedy, gdy na robocie pojawiają się ludzkie korekty.
Zero etykiet siły w danych wizyjnych
Jeden model trenuje na dwóch niespójnych zbiorach. Demonstracje zebrane ręcznym urządzeniem mają pamięć siły zamaskowaną przed cross-attention, co blokuje gradienty w ścieżce siły. Pomiary pojawiają się tylko w ludzkich korektach zbieranych na robocie przez Flexiv TDK. Syntetycznych etykiet nie ma, a próbkowanie offline do online trzyma stosunek 1:1.
Co mówią ablacje
Post-trening z siłą uczy się szybciej i osiąga wyższą skuteczność szczytową oraz końcową niż czysto wizyjny DAgger online — na wszystkich trzech zadaniach. Autorzy nie podają wartości procentowych — porównania opierają się na krzywych uczenia.
Ablacje pokazują też, co nie działa: wariant z zamrożonym buforem korekt zamiast agregacji online uzyskuje zero punktów przy wkładaniu książki, a lekka polityka rezydualna nad zamrożoną π0.5 zostaje daleko w tyle.
Dlaczego to ważne?
Dominujące podejście do siły w robotyce zakłada zbieranie danych siłowych od początku, co zamyka drogę do gotowych, czysto wizyjnych checkpointów. LIFT odwraca kolejność: bierze pretrenowany VLA i dokłada modalność na końcu, przy niewielkim koszcie danych.
Zmienia to ekonomię zbierania danych — zamiast dużych korpusów siłowych liczy się jakość kilkudziesięciu epizodów korekcyjnych. Próg wejścia w manipulację kontaktową spada z nowego pretreningu do kilku godzin pracy na stanowisku.
Co dalej?
- Autorzy wskazują przepustowość ludzkich korekt jako wąskie gardło — jeden eksperyment online to 2–3 godziny i około 20–30 epizodów
- Ewaluacja objęła jedno ramię robota, kolejny krok to testy na innych manipulatorach, czujnikach siły i chwytakach
Źródła
- Maszynowe Serce — CoRL 2026 | 0条带力数据预训练!上海交大卢策吾、汶川团队让VLA学会力
- arXiv — Never Too Late for Force: Accelerating VLA Post-Training with Reactive Force Injection
- Strona projektu LIFT — LIFT: Never Too Late for Force
- GitHub — y-wng/lift





