Robocurve, niezależny ewaluator robotyki wspierany przez Y Combinator, podłączył GPT-6 Astra bezpośrednio do dwuramiennego robota — bez żadnego wyuczonego modelu w ścieżce sterowania. Przy przenoszeniu klocka model zaliczył 19 z 20 prób wobec 8 dla Claude Fable 5.1. Przy zadaniu precyzyjnym oba modele utknęły na identycznym wyniku.
Najważniejsze w skrócie
- Klocek do miski: GPT-6 Astra 19/20, Claude Fable 5.1 8/20, Claude Fable 5 1/20
- Element układanki w wyżłobienie: Astra i Fable 5.1 po 2/20 — przewaga znika
- Zużycie tokenów wyjścia: 2,1 tys. na próbę wobec 12,9 tys. dla Fable 5.1
- Koszt próby 0,94 USD wobec 2,12 USD, czas 2,5 minuty wobec 6,8
- Zespół RoboDojo przerwał testy na fizycznym robocie po uszkodzeniach sprzętu
Ścieżka sterowania bez wyuczonej polityki
Model dostaje trzy widoki z kamer i odsyła absolutne pozy chwytaka. Kinematyka odwrotna robota sama przelicza je na kąty przegubów — żadnej wyuczonej polityki po drodze.
Diagram pokazuje, co dzieli obraz z kamery od ruchu ramienia w teście Robocurve. Między modelem a robotem nie ma żadnej wytrenowanej polityki — pozycje chwytaka idą wprost do klasycznego solwera kinematyki odwrotnej.
Przewaga znika tam, gdzie trzeba precyzji
Przy przenoszeniu czerwonego klocka do miski Astra kończy 19 z 20 prób. Przy wkładaniu okrągłego elementu układanki w dopasowane wyżłobienie schodzi do 2 z 20, dokładnie tyle co Fable 5.1, a w średniej ocenie etapowej wypada nawet gorzej (2,00 wobec 2,35). Raport odnotowuje, że model dociera do wyżłobienia i zacina się na tym samym ostatnim kroku co konkurent.
| Miara | GPT-6 Astra | Claude Fable 5.1 | Claude Fable 5 |
|---|---|---|---|
| Klocek do miski | 19/20 | 8/20 | 1/20 |
| Element układanki w wyżłobienie | 2/20 | 2/20 | — |
| Średnia ocena etapowa (układanka) | 2,00 | 2,35 | — |
| Tokeny wyjścia na próbę | 2,1 tys. | 12,9 tys. | — |
| Koszt próby | 0,94 USD | 2,12 USD | — |
| Czas próby | 2,5 min | 6,8 min | — |
Testy na fizycznym robocie trzeba było wstrzymać
Niezależną ocenę prowadził także zespół benchmarku RoboDojo.
Astra wielokrotnie wydawała fizycznie nieracjonalne lub niebezpieczne polecenia podczas prób na prawdziwym robocie, a część incydentów uszkodziła sprzęt. Testowanie zostało w związku z tym zatrzymane, a pełny oficjalny protokół 18 zadań nie został wykonany.
Zespół RoboDojo, raport z 16 września 2026.
W symulacji obraz jest dwubiegunowy: na 42 zadaniach model przekracza 50% skuteczności w dziesięciu, ale w szesnastu nie zalicza ani jednej próby.
Co naprawdę działa
Zaskakująco dobrze wypada adaptacja w locie — model sam wykrywa i koryguje obrócony obraz, odwrócone znaki osi czy losowe siły zakłócające. Odwrotnie działa uczenie z kontekstu: jedna demonstracja obniżyła skuteczność z 22,9% do 17,9%, a demonstracja opisana tekstem do 12,9%.
Dlaczego to ważne?
Wynik z klockiem łatwo sprzedać jako dowód, że model ogólny wystarczy do sterowania robotem. Rozbicie na dwa zadania pokazuje, gdzie przebiega granica: tam, gdzie liczy się kontakt, siła i geometria, przewaga znika. Przyspieszenie generowania tokenów rozwiąże kwestię latencji, ale nie zastąpi wiedzy o fizyce, której model nie ma skąd wziąć z samego tekstu i obrazu.
Co dalej?
- Robocurve prognozuje, że modele klasy Fable będą sterować robotem w czasie rzeczywistym między końcem 2026 a 2029 rokiem
- Pełny 18-zadaniowy protokół RoboDojo-Real dla Astry pozostaje niewykonany
- Porównanie Robocurve ma ograniczenia: próby obu modeli dzieliły dwa dni, a zadanie z klockiem wykonano na różnych stanowiskach





