Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

GPT-6 Astra steruje ramieniem robota. 95% tylko w łatwym teście

Pan Robocik29 września 2026 · 3 min czytania
GPT-6 Astra steruje ramieniem robota. 95% tylko w łatwym teście

Robocurve, niezależny ewaluator robotyki wspierany przez Y Combinator, podłączył GPT-6 Astra bezpośrednio do dwuramiennego robota — bez żadnego wyuczonego modelu w ścieżce sterowania. Przy przenoszeniu klocka model zaliczył 19 z 20 prób wobec 8 dla Claude Fable 5.1. Przy zadaniu precyzyjnym oba modele utknęły na identycznym wyniku.

Najważniejsze w skrócie

  • Klocek do miski: GPT-6 Astra 19/20, Claude Fable 5.1 8/20, Claude Fable 5 1/20
  • Element układanki w wyżłobienie: Astra i Fable 5.1 po 2/20 — przewaga znika
  • Zużycie tokenów wyjścia: 2,1 tys. na próbę wobec 12,9 tys. dla Fable 5.1
  • Koszt próby 0,94 USD wobec 2,12 USD, czas 2,5 minuty wobec 6,8
  • Zespół RoboDojo przerwał testy na fizycznym robocie po uszkodzeniach sprzętu

Ścieżka sterowania bez wyuczonej polityki

Model dostaje trzy widoki z kamer i odsyła absolutne pozy chwytaka. Kinematyka odwrotna robota sama przelicza je na kąty przegubów — żadnej wyuczonej polityki po drodze.

Trzy widoki z kamerwejście
GPT-6 Astramodel ogólnego przeznaczenia
Absolutne pozy chwytakawyjście modelu
Kinematyka odwrotna robotakąty przegubów
Ruch ramionwykonanie
Ścieżka sterowania w teście Robocurve.

Diagram pokazuje, co dzieli obraz z kamery od ruchu ramienia w teście Robocurve. Między modelem a robotem nie ma żadnej wytrenowanej polityki — pozycje chwytaka idą wprost do klasycznego solwera kinematyki odwrotnej.

Przewaga znika tam, gdzie trzeba precyzji

Przy przenoszeniu czerwonego klocka do miski Astra kończy 19 z 20 prób. Przy wkładaniu okrągłego elementu układanki w dopasowane wyżłobienie schodzi do 2 z 20, dokładnie tyle co Fable 5.1, a w średniej ocenie etapowej wypada nawet gorzej (2,00 wobec 2,35). Raport odnotowuje, że model dociera do wyżłobienia i zacina się na tym samym ostatnim kroku co konkurent.

MiaraGPT-6 AstraClaude Fable 5.1Claude Fable 5
Klocek do miski19/208/201/20
Element układanki w wyżłobienie2/202/20—
Średnia ocena etapowa (układanka)2,002,35—
Tokeny wyjścia na próbę2,1 tys.12,9 tys.—
Koszt próby0,94 USD2,12 USD—
Czas próby2,5 min6,8 min—
Wyniki testu Robocurve. Fable 5 nie był mierzony na zadaniu precyzyjnym ani pod kątem kosztu.
2/20skuteczność GPT-6 Astra w zadaniu precyzyjnym, dokładnie tyle samo co Claude Fable 5.1Robocurve

Testy na fizycznym robocie trzeba było wstrzymać

Niezależną ocenę prowadził także zespół benchmarku RoboDojo.

Astra wielokrotnie wydawała fizycznie nieracjonalne lub niebezpieczne polecenia podczas prób na prawdziwym robocie, a część incydentów uszkodziła sprzęt. Testowanie zostało w związku z tym zatrzymane, a pełny oficjalny protokół 18 zadań nie został wykonany.

Zespół RoboDojo, raport z 16 września 2026.

W symulacji obraz jest dwubiegunowy: na 42 zadaniach model przekracza 50% skuteczności w dziesięciu, ale w szesnastu nie zalicza ani jednej próby.

Co naprawdę działa

Zaskakująco dobrze wypada adaptacja w locie — model sam wykrywa i koryguje obrócony obraz, odwrócone znaki osi czy losowe siły zakłócające. Odwrotnie działa uczenie z kontekstu: jedna demonstracja obniżyła skuteczność z 22,9% do 17,9%, a demonstracja opisana tekstem do 12,9%.

Dlaczego to ważne?

Wynik z klockiem łatwo sprzedać jako dowód, że model ogólny wystarczy do sterowania robotem. Rozbicie na dwa zadania pokazuje, gdzie przebiega granica: tam, gdzie liczy się kontakt, siła i geometria, przewaga znika. Przyspieszenie generowania tokenów rozwiąże kwestię latencji, ale nie zastąpi wiedzy o fizyce, której model nie ma skąd wziąć z samego tekstu i obrazu.

Co dalej?

  • Robocurve prognozuje, że modele klasy Fable będą sterować robotem w czasie rzeczywistym między końcem 2026 a 2029 rokiem
  • Pełny 18-zadaniowy protokół RoboDojo-Real dla Astry pozostaje niewykonany
  • Porównanie Robocurve ma ograniczenia: próby obu modeli dzieliły dwa dni, a zadanie z klockiem wykonano na różnych stanowiskach

Źródła

Udostępnij ten artykuł