Niezależny projekt DrivingBench dał czterem czołowym modelom językowym kontrolę nad prawdziwą Toyotą Corollą z 2022 roku i kazał im przejechać tor z pachołków na parkingu. Do mety dojechał tylko GPT-6 Astra: 134,7 metra w 5 minut i 22 sekundy. Żadnego z modeli nie szkolono pod kątem jazdy autonomicznej.
Najważniejsze w skrócie
- GPT-6 Astra ukończył 100% toru w drugiej próbie: 134,7 m w 5:22, 24 komendy ruchu
- Claude Fable 5.1 dotarł do 45% trasy, Grok 4.6 do 11%, a GPT-5.6 Sol do 6%
- Druga próba Astry: 6,6 mln tokenów i 7,74 USD (ok. 28 zł)
- Autem sterowały trzy narzędzia MCP spięte z openpilotem i comma four
- Nazwanie serwera MCP „DrivingBench Sandbox” ograniczyło odmowy
| Model | Ukończenie toru | Dystans |
|---|---|---|
| GPT-6 Astra | 100% | 134,7 m |
| Claude Fable 5.1 | 45% | nie podano |
| Grok 4.6 | 11% | nie podano |
| GPT-5.6 Sol | 6% | nie podano |
Corolla, comma four i trzy narzędzia
W Corolli zamontowano comma four, wpięte kablem OBD-C w magistralę CAN?Magistrala CAN: Wewnętrzna sieć pojazdu, po której sterowniki wymieniają komunikaty o prędkości, kierownicy i hamulcach., a sterowanie oparto na openpilocie. Kamery i telemetria idą przez laptopa do serwera MCP, a stamtąd do modelu w kliencie Codex, Claude Code lub Cursor.
Narzędzia są trzy: observe() zwraca klatki i prędkość, set_motion() zadaje kierunek, procent skrętu, prędkość i czas komendy, a stop_now() hamuje. Momentu na kierownicy ani ciśnienia w hamulcach model nie liczy, bo robi to openpilot.
Uczenie w kontekście, bez dotykania wag
Trzy podejścia szły w jednej rozmowie. Pierwsza próba Astry skończyła się na 49% trasy i 67,3 metra, gdy operator przejął hamulec. Potem model dostawał prompt refleksyjny.
Zbyt wcześnie uznałem, że auto jest wyrównane. […] Wyprostowałem tor i podniosłem zadaną prędkość do 1,5 m/s.
GPT-6 Astra, refleksja cytowana w raporcie DrivingBench.
W drugiej próbie model nie przekroczył 0,8 m/s i w 20 z 24 komend zażądał 100% skrętu. Średnia prędkość to około 0,42 m/s, czyli 1,5 km/h.
Czego ten test nie pokazuje
Każdy model przeszedł jedną sesję, a trzy podejścia dzielą ten sam kontekst. Parking chroniły twarde limity: 0,5–3,5 m/s, awaryjne odcięcie przy 6 m/s i operator z nogą nad hamulcem.
Przednia kamera nie widzi przeszkód tuż przy aucie. To Astra najczęściej odmawiała jazdy ze względów bezpieczeństwa.
Dlaczego to ważne?
Wynik nie mówi nic o jakości jazdy, bo 1,5 km/h to tempo spaceru. Mówi natomiast, że ogólny model potrafi zamknąć pętlę percepcja–plan–sterowanie w fizycznym świecie przez zwykłe API narzędziowe i skorygować własny błąd bez zmiany wag. Dla motoryzacji istotniejsze od samego przejazdu jest to, że warstwa decyzyjna auta nie musi już pochodzić z klasycznego stosu autonomicznej jazdy, tylko z ogólnego modelu sterowanego narzędziami.
Co dalej?
- DrivingBench v2 ma objąć wielokrotne sesje, różne poziomy reasoningu i trudniejszy tor
- Harness i prompty są na GitHubie, ale powtórzenie wymaga Corolli i comma four
- Autorzy zapowiadają osobny materiał o bezpieczeństwie i alignmencie
Źródła
- DrivingBench — Report
- DrivingBench — Leaderboard
- 钛媒体 TMTPost — 不用专门训练自动驾驶,GPT-6 Astra已经能开真车了?
- GitHub — drivingbench_harness_v1





