Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

LIFT uczy modele VLA siły dopiero na etapie post-treningu

Pan Robocik2 października 2026 · 3 min czytania
LIFT uczy modele VLA siły dopiero na etapie post-treningu

Zespół Shanghai Jiao Tong University pokazał LIFT — metodę, dzięki której pretrenowana polityka VLA zaczyna reagować na siłę kontaktu, choć w pretreningu nie widziała ani jednej etykiety siły. Praca została przyjęta na CoRL 2026, a kod jest publicznie dostępny.

Najważniejsze w skrócie

  • LIFT doszczepia reaktywnego eksperta akcji obok oryginalnego w pretrenowanej polityce pi-0.5
  • Historia siły 6D wchodzi przez cross-attention z zerowaną projekcją — model startuje z zachowaniem bazy
  • Testy na ramieniu Flexiv Rizon 4S: składanie ręcznika, wkładanie książki, pierścień Hanoi
  • Ewaluacja: 30 autonomicznych przebiegów na checkpoint, 95-procentowe przedziały ufności
  • Autorzy korespondencyjni: Chuan Wen i Cewu Lu, arXiv 2607.14236

Siła dopiero na końcu, prior nienaruszony

Pretrenowane polityki VLA rozumieją polecenia językowe, ale sterują niemal wyłącznie obrazem. W kontakcie to przestaje wystarczać: scena bywa zasłonięta, głębia niejednoznaczna, a drobny błąd siły wypycha wykonanie poza rozkład demonstracji.

LIFT kopiuje wagi oryginalnego eksperta akcji do nowego, reaktywnego strumienia, a ścieżkę siły podłącza przez cross-attention z zerowaną projekcją wyjściową. Przed post-treningiem residual siły jest zerowy, więc model zachowuje się identycznie jak baza.

Reaktywny strumień dekoduje akcje przyczynowo wewnątrz action chunking: Przewidywanie od razu całej krótkiej sekwencji akcji zamiast pojedynczego kroku sterowania. Chunk to taka porcja akcji., zamiast odtwarzać go w pętli otwartej, a wolny prefiks wizyjno-językowy liczony jest raz i trafia do cache'u.

Przed LIFT
Pretrenowany VLAπ0.5 — obraz i język, zero etykiet siły
LIFT
Kopia eksperta akcjireaktywny strumień obok oryginalnego
Cross-attention z zerowaną projekcjąwejście: historia siły 6D
Post-trening online na korektachludzkie korekty na robocie, offline do online 1:1
Po LIFT
Polityka reaguje na kontaktAllow
Pipeline LIFT — siła dochodzi dopiero po pretreningu, prior bazowej polityki zostaje nienaruszony

Diagram pokazuje, dlaczego LIFT nie psuje bazowego modelu. Zerowana projekcja wyjściowa sprawia, że przed post-treningiem residual siły wynosi zero, a polityka zachowuje się dokładnie jak pretrenowany π0.5. Sygnał siły zaczyna wpływać na akcje dopiero wtedy, gdy na robocie pojawiają się ludzkie korekty.

Zero etykiet siły w danych wizyjnych

Jeden model trenuje na dwóch niespójnych zbiorach. Demonstracje zebrane ręcznym urządzeniem mają pamięć siły zamaskowaną przed cross-attention, co blokuje gradienty w ścieżce siły. Pomiary pojawiają się tylko w ludzkich korektach zbieranych na robocie przez Flexiv TDK. Syntetycznych etykiet nie ma, a próbkowanie offline do online trzyma stosunek 1:1.

Co mówią ablacje

Post-trening z siłą uczy się szybciej i osiąga wyższą skuteczność szczytową oraz końcową niż czysto wizyjny DAgger online — na wszystkich trzech zadaniach. Autorzy nie podają wartości procentowych — porównania opierają się na krzywych uczenia.

Ablacje pokazują też, co nie działa: wariant z zamrożonym buforem korekt zamiast agregacji online uzyskuje zero punktów przy wkładaniu książki, a lekka polityka rezydualna nad zamrożoną π0.5 zostaje daleko w tyle.

Dlaczego to ważne?

Dominujące podejście do siły w robotyce zakłada zbieranie danych siłowych od początku, co zamyka drogę do gotowych, czysto wizyjnych checkpointów. LIFT odwraca kolejność: bierze pretrenowany VLA i dokłada modalność na końcu, przy niewielkim koszcie danych.

Zmienia to ekonomię zbierania danych — zamiast dużych korpusów siłowych liczy się jakość kilkudziesięciu epizodów korekcyjnych. Próg wejścia w manipulację kontaktową spada z nowego pretreningu do kilku godzin pracy na stanowisku.

Co dalej?

  • Autorzy wskazują przepustowość ludzkich korekt jako wąskie gardło — jeden eksperyment online to 2–3 godziny i około 20–30 epizodów
  • Ewaluacja objęła jedno ramię robota, kolejny krok to testy na innych manipulatorach, czujnikach siły i chwytakach

Źródła

Udostępnij ten artykuł