Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Psi-R2.5 uczy robota z jednej demonstracji zamiast pięćdziesięciu

Pan Robocik29 września 2026 · 2 min czytania
Psi-R2.5 uczy robota z jednej demonstracji zamiast pięćdziesięciu

Chińska firma PsiBot pokazała Psi-R2.5 — model bazowy dla robotów, któremu nowe zadanie manipulacyjne pokazuje się raz, zamiast nagrywać kilkadziesiąt teleoperowanych powtórzeń. Kluczem nie jest większy model, lecz sposób produkcji danych: firma odwróciła własny pipeline, żeby masowo generować pary „człowiek–robot” o dokładnej odpowiedniości klatka po klatce.

Najważniejsze w skrócie

  • Dwuwarstwowa architektura: planner na bazie QwenVL3.5-4B, kontroler na bazie Wan2.2-TI2V-5B
  • „Strong pair data”: zgodność klatka po klatce i akcja odtwarzalna wprost na robocie
  • Montaż pudełka na telefon: 99% skuteczności po kilku iteracjach, w 1–2 dni robocze
  • Zestaw ewaluacyjny: 50 złożonych zadań na prawdziwym robocie z losowanym stanem początkowym
  • Pipeline działa też na nagraniu ze zwykłego telefonu

Czym różni się „strong pair data”

Dotychczas pary danych ludzkich i robotycznych łączyła wyłącznie semantyka zadania — człowiek i robot podnosili tę samą butelkę, ale wszystko poza tym się różniło. W wariancie „strong” obraz poza samym ciałem wykonawcy jest zasadniczo identyczny, a zarejestrowana akcja daje się odtworzyć bezpośrednio na robocie. Firma opisuje to jako sprowadzenie dynamiki ludzkiej dłoni do tej samej Domena danych: Zbiór wspólnych właściwości nagrania — kadr, oświetlenie, dynamika ruchu. Dane z różnych domen model traktuje jak dwa osobne światy. co dynamika robota.

KryteriumWeak pair dataStrong pair data
Co łączy parętylko semantyka zadaniaobraz poza ciałem wykonawcy
Zgodność w czasiebrakklatka po klatce
Akcja na robocienieodtwarzalna wprostodtwarzalna bezpośrednio
Dwa rodzaje par danych według opisu PsiBot.

Odwrócony pipeline

Wcześniej PsiBot szedł od danych ludzkich do robotycznych, używając modelu świata Psi-W0 i uczenia ze wzmocnieniem — kosztownie, z rolloutami dla każdej próbki. Teraz kierunek jest odwrotny.

Wcześniej
Nagrania ludzkiej dłonipunkt wyjścia
Psi-W0 + uczenie ze wzmocnieniemrollout dla każdej próbki
Dane robotycznekosztowne
Teraz
Realne dane z robotapunkt wyjścia
Psi-W0 dogenerowuje nagranie dłonikierunek odwrócony
Jeden model konwersji, bez RLcałość zdestylowana
Stary i nowy kierunek produkcji par danych w PsiBot.

Diagram zestawia dwa kierunki tego samego pipeline’u. W starym wariancie punktem wyjścia były nagrania człowieka, a każda próbka wymagała kosztownego rolloutu. W nowym startuje się od realnych danych robota, a model świata dogenerowuje do nich pasujące nagranie ludzkiej dłoni.

Trzy modele w układance:

QwenVL3.5-4Bbaza plannera
Wan2.2-TI2V-5Bbaza kontrolera
Psi-W0model świata, generuje nagrania dłoni

Jakość weryfikują dwa testy: dane muszą dać się odtworzyć na fizycznym robocie i muszą nadawać się do post-treningu, który uogólnia się na pokrewne zadania.

99%skuteczność montażu pudełka na telefon po kilku iteracjach, osiągnięta w 1–2 dni roboczePsiBot

Czego nie podano

Psi-R2.5 nie ma publikacji naukowej ani repozytorium — jedynym źródłem technicznym jest blog firmy. Wyniki liczbowe z zestawu 50 zadań nie zostały opublikowane, a zestawienie „jedna demonstracja zamiast pięćdziesięciu” to rama narracyjna artykułu, nie kontrolowane porównanie.

Dlaczego to ważne?

Przez ostatnie dwa lata embodied AI skalowało się liczbą godzin nagrań. PsiBot twierdzi, że po przekroczeniu 100 tys. godzin materiału ludzkiego dorzucanie kolejnych przestaje pomagać, bo stosunek sygnału do szumu w nagraniu z kamery jest znacznie gorszy niż w danych z prawdziwego robota. Jeśli to się potwierdzi, przewagę zbudują zespoły z lepszym pipeline’em konwersji, nie z większym dyskiem.

Co dalej?

  • Firma zapowiedziała szczegóły techniczne uczenia z kontekstu w kolejnej publikacji
  • Wyniki liczbowe z zestawu 50 zadań pozostają nieopublikowane
  • Brak recenzowanej pracy i kodu utrudnia niezależną weryfikację

Źródła

Udostępnij ten artykuł