Chińska firma PsiBot pokazała Psi-R2.5 — model bazowy dla robotów, któremu nowe zadanie manipulacyjne pokazuje się raz, zamiast nagrywać kilkadziesiąt teleoperowanych powtórzeń. Kluczem nie jest większy model, lecz sposób produkcji danych: firma odwróciła własny pipeline, żeby masowo generować pary „człowiek–robot” o dokładnej odpowiedniości klatka po klatce.
Najważniejsze w skrócie
- Dwuwarstwowa architektura: planner na bazie QwenVL3.5-4B, kontroler na bazie Wan2.2-TI2V-5B
- „Strong pair data”: zgodność klatka po klatce i akcja odtwarzalna wprost na robocie
- Montaż pudełka na telefon: 99% skuteczności po kilku iteracjach, w 1–2 dni robocze
- Zestaw ewaluacyjny: 50 złożonych zadań na prawdziwym robocie z losowanym stanem początkowym
- Pipeline działa też na nagraniu ze zwykłego telefonu
Czym różni się „strong pair data”
Dotychczas pary danych ludzkich i robotycznych łączyła wyłącznie semantyka zadania — człowiek i robot podnosili tę samą butelkę, ale wszystko poza tym się różniło. W wariancie „strong” obraz poza samym ciałem wykonawcy jest zasadniczo identyczny, a zarejestrowana akcja daje się odtworzyć bezpośrednio na robocie. Firma opisuje to jako sprowadzenie dynamiki ludzkiej dłoni do tej samej domeny?Domena danych: Zbiór wspólnych właściwości nagrania — kadr, oświetlenie, dynamika ruchu. Dane z różnych domen model traktuje jak dwa osobne światy. co dynamika robota.
| Kryterium | Weak pair data | Strong pair data |
|---|---|---|
| Co łączy parę | tylko semantyka zadania | obraz poza ciałem wykonawcy |
| Zgodność w czasie | brak | klatka po klatce |
| Akcja na robocie | nieodtwarzalna wprost | odtwarzalna bezpośrednio |
Odwrócony pipeline
Wcześniej PsiBot szedł od danych ludzkich do robotycznych, używając modelu świata Psi-W0 i uczenia ze wzmocnieniem — kosztownie, z rolloutami dla każdej próbki. Teraz kierunek jest odwrotny.
Diagram zestawia dwa kierunki tego samego pipeline’u. W starym wariancie punktem wyjścia były nagrania człowieka, a każda próbka wymagała kosztownego rolloutu. W nowym startuje się od realnych danych robota, a model świata dogenerowuje do nich pasujące nagranie ludzkiej dłoni.
Trzy modele w układance:
Jakość weryfikują dwa testy: dane muszą dać się odtworzyć na fizycznym robocie i muszą nadawać się do post-treningu, który uogólnia się na pokrewne zadania.
Czego nie podano
Psi-R2.5 nie ma publikacji naukowej ani repozytorium — jedynym źródłem technicznym jest blog firmy. Wyniki liczbowe z zestawu 50 zadań nie zostały opublikowane, a zestawienie „jedna demonstracja zamiast pięćdziesięciu” to rama narracyjna artykułu, nie kontrolowane porównanie.
Dlaczego to ważne?
Przez ostatnie dwa lata embodied AI skalowało się liczbą godzin nagrań. PsiBot twierdzi, że po przekroczeniu 100 tys. godzin materiału ludzkiego dorzucanie kolejnych przestaje pomagać, bo stosunek sygnału do szumu w nagraniu z kamery jest znacznie gorszy niż w danych z prawdziwego robota. Jeśli to się potwierdzi, przewagę zbudują zespoły z lepszym pipeline’em konwersji, nie z większym dyskiem.
Co dalej?
- Firma zapowiedziała szczegóły techniczne uczenia z kontekstu w kolejnej publikacji
- Wyniki liczbowe z zestawu 50 zadań pozostają nieopublikowane
- Brak recenzowanej pracy i kodu utrudnia niezależną weryfikację
Źródła
- 机器之心 — 具身智能开始拼高质量数据了!灵初Psi-R2.5用强 Pair Data重做训练链路
- PsiBot — Scaling Pair Data for Embodied Intelligence
- PsiBot — About us





