Kluczowy trik PsiBot polega na odwróceniu zwykłego kierunku: zamiast przekładać nagranie człowieka na dane robota, model świata Psi-W0 generuje odwrotnie dane ręki ludzkiej z istniejących trajektorii robota. Następnie trenuje się transformer w stylu edycji wideo — nie politykę — który mapuje wejście z ręką człowieka na dopasowane wyjście robota. Dzięki temu obfite dane robota służą do syntezy dopasowanych demonstracji człowieka, a nie odwrotnie (odwrotność klasycznego podejścia sim2real). Jakość weryfikuje się dwutorowo: bezpośrednim odtworzeniem akcji na fizycznym robocie oraz skutecznością dostrajania zadań końcowych.
Nagrania człowieka są tanie i liczne, ale nie da się ich wprost użyć do trenowania robota: różni się wygląd (ręka człowieka vs chwytak) i kinematyka ruchu. Luźno zebrane dane o zgodnej intencji nie wystarczają, bo model musi sam domyślić się odwzorowania. Silne dane sparowane usuwają ten domysł, dostarczając jawne, zsynchronizowane odwzorowanie człowiek→robot.
Demonstracja człowieka i odpowiadająca jej trajektoria robota są zsynchronizowane na poziomie pojedynczych klatek, a nie tylko całego zadania.
Scena w obu nagraniach jest ta sama, z pominięciem różnic wynikających wyłącznie z odmiennego ucieleśnienia.
Zapisane akcje muszą dać się bezpośrednio odtworzyć na robocie z powodzeniem — to jednocześnie definicja i test jakości pary.
Model świata Psi-W0 generuje dane ręki ludzkiej z trajektorii robota, po czym transformer w stylu edycji wideo domyka odwzorowanie człowiek→robot.
Ręczne zbieranie zsynchronizowanych par człowiek–robot jest kosztowne i słabo skalowalne; bez syntezy przez model świata rygor łatwo staje się wąskim gardłem.
Para spełniająca dopasowanie czasowe i scenę, ale z akcjami, których robot nie odtworzy poprawnie, nie jest silną parą — brak testu odtworzenia zatruwa zbiór.
PsiBot opisał strong pair data w blogu technicznym towarzyszącym premierze Psi-R2.5, przedstawiając je jako rdzeń przebudowanego łańcucha treningowego.