Zespół RLinf rozbudował we wrześniu RPent — otwarty framework, który opakowuje zamrożony model VLA w agenta z planerem LLM i pamięcią. Na benchmarku LIBERO-PRO sam π0.5 kończy 11,0% zadań. Ten sam model pod kontrolą RPent osiąga 92,63%. Kod jest dostępny na licencji Apache-2.0.
Najważniejsze w skrócie
- 92,63% skuteczności (741/800) na LIBERO-PRO, planer Codex na GPT-6 Astra
- Ten sam zamrożony π0.5 bez RPent: 11,0%
- Licencja Apache-2.0, 875 gwiazdek na GitHubie
- We wrześniu doszła obsługa realnych robotów: Franka jedno- i dwuramienna
- Tryb bez rozumowania skraca średni czas wykonania o ok. 40%
Zamrożony model jako jedno narzędzie
VLA dobrze radzą sobie z precyzyjnym kontaktem. Gorzej z długimi zadaniami i zmianą warunków. Wystarczy przestawić obiekty albo przeformułować polecenie, żeby skuteczność runęła.
RPent nie dotrenowuje modelu. Zamiast tego wystawia go jako jeden „prymityw?Prymityw: Pojedyncza, wielokrotnie wywoływalna operacja w bibliotece agenta — tu: jedno wywołanie zamrożonego modelu VLA albo operacja analityczna.", który można wywołać ponownie po nieudanej próbie. Resztę — semantykę, nawigację, ustawienie się przed chwytem, zwolnienie obiektu — obsługuje planer i stała biblioteka analitycznych operacji.
Co pokazuje leaderboard
| Konfiguracja | Skuteczność |
|---|---|
| π0 | 0,3% |
| X-VLA | 3,8% |
| π0.5 (samodzielnie) | 11,0% |
| RPent + Qwen3.6 27B, bez rozumowania | 70,63% |
| RPent + Codex na GPT-6 Astra | 92,63% |
Poza symulatorem zadań stołowych framework raportuje 59,20% na RoboCasa365 Target50 i 58,4% na RoboTwin C2R. Publikacja z lipca podaje przewagę 38,6 punktu procentowego nad najlepszą porównywalną metodą na LIBERO-PRO.
Wyjście na prawdziwy sprzęt
Do września RPent był głównie narzędziem symulacyjnym. Teraz doszły rozszerzenia dla ramion Franka — pojedynczego i podwójnego. Obsługiwane planery to Claude Code i Codex, a jako prymitywy działania: π0.5, RLDX-1 i LingBot-VLA.
Dlaczego to ważne?
Branża od dwóch lat zakłada, że droga do niezawodnej manipulacji prowadzi przez większe modele i więcej danych treningowych. RPent pokazuje inną ścieżkę: ten sam model, inna obudowa, ośmiokrotnie lepszy wynik. To przesuwa punkt ciężkości z wag na architekturę agenta — i oznacza, że wiele istniejących VLA może być po prostu źle wykorzystywanych.
Co dalej?
- Leaderboard jest publiczny i przyjmuje kolejne konfiguracje — wyniki da się sprawdzić niezależnie
- Na liście wspieranego sprzętu czekają jeszcze SO-101 i YAM, oznaczone jako niegotowe
- Repozytorium zapowiada integrację z modelem świata DreamZero obok istniejących prymitywów VLA





