OpenAI udostępniło 3 września GPT-6 Astra — model agentowy, który sam obsługuje przeglądarkę, arkusz i aplikacje zamiast podpowiadać, co w nich kliknąć. Greg Brockman skwitował premierę słowami „Welcome to the AGI era”. Niezależne pomiary są ostrożniejsze: model dominuje w zadaniach bezpieczeństwa, ale w ogólnym rankingu inteligencji zostaje za Claude Fable 5.1.
Najważniejsze w skrócie
- Premiera 3 września 2026, w API jako gpt-6-astra — 10 USD za mln tokenów wejściowych i 50 USD za wyjściowych (ok. 40 i 200 zł)
- ARC-AGI-3: 99,9% na autorskim harnessie OpenAI, 62,7% na standardowym
- ExploitBench: 100% wobec 78,5% dla GPT-5.6 Sol
- Intelligence Index Artificial Analysis: 61 pkt, pięć poniżej Claude Fable 5.1
- Status Critical dla cyberbezpieczeństwa w Preparedness Framework OpenAI
Agent, który klika sam
Astra to computer use model?Computer use model: Model, który steruje interfejsem komputera tak jak człowiek — klika, przewija i wpisuje w istniejących aplikacjach, zamiast zwracać sam tekst do ręcznego przeklejenia.: zamiast generować tekst do skopiowania, sam obsługuje przeglądarkę, CRM i arkusz kalkulacyjny. Rollout ruszył od wąskiej grupy organizacji w programie Daybreak i w kolejnych dniach obejmie ChatGPT Plus, Pro, Business i Enterprise, API, AWS Bedrock oraz Azure. OpenAI podaje, że trening pochłonął ponad 100 tys. DBU na infrastrukturze Stargate — największy skok w historii firmy.
Wynik zależy od harnessu
Najgłośniejsza liczba premiery wymaga gwiazdki. Jak podaje ARC Prize, Astra osiąga 99,9% na ARC-AGI-3 Semi-Private za około 19 tys. USD, ale tylko z autorskim harnessem?Harness: Warstwa uruchomieniowa między modelem a benchmarkiem: decyduje, co model widzi między turami, ile stanu zachowuje i jak długa może być rozmowa. Ten sam model daje różne wyniki na różnych harnessach. Provider Adapter, który przechowuje nieprzejrzysty stan rozumowania między zapytaniami. Na standardowym harnessie wynik spada do 62,7%, a koszt rośnie do 26 tys. USD.
| Poziom reasoning | Standard harness | Provider Adapter |
|---|---|---|
| max | 62,7% · 26 098 USD | 98,6% · 17 332 USD |
| xhigh | 59,3% · 37 317 USD | 98,4% · 18 147 USD |
| high | 54,8% · 40 705 USD | 99,9% · 18 817 USD |
| medium | 38,6% · 48 090 USD | 98,4% · 19 285 USD |
| low | 17,5% · 38 166 USD | 98,0% · 21 298 USD |
| none | 35,2% · 49 791 USD | 96,7% · 23 457 USD |
Ciekawszy jest inny rezultat. Model zużył o 51,7% mniej akcji na poziom, niż wynosi mediana dla testowanych ludzi, i był oszczędniejszy na 96% poziomów. ARC Prize zastrzega przy tym, że wysycenie benchmarku nie dowodzi osiągnięcia AGI.
Mocny w kodzie ofensywnym
Astra dominuje tam, gdzie liczy się bezpieczeństwo — 100% na ExploitBench wobec 78,5% dla GPT-5.6 Sol i 99,2% w czterech próbach na SRE-Bench przy 68,7% poprzednika. Radzi sobie też z długim kontekstem: 96,3% powyżej pół miliona tokenów. W ogólnym Intelligence Index zatrzymuje się jednak na 61 punktach, przegrywając z Fable 5.1 i Muse Spark 1.3. Wyników GDPval zabrakło w materiałach premierowych.
Dlaczego to ważne?
Premiera przesuwa punkt ciężkości z jakości pojedynczej odpowiedzi na zdolność doprowadzenia zadania do końca w cudzym oprogramowaniu. Zmienia to sposób wyceny — liczy się koszt ukończonego zadania, nie tokena. Rozbieżność między harnessami pokazuje przy tym, że wyniki benchmarków zaczynają zależeć od infrastruktury dostawcy, a nie samego modelu. Porównywanie laboratoriów staje się przez to wyraźnie trudniejsze.
Co dalej?
- Szersza dostępność w ChatGPT Plus, Pro, Business i Enterprise oraz w AWS Bedrock i Azure ma nastąpić w ciągu kilku dni od 3 września
- Claude Fable 5.1 nie ma opublikowanego wyniku na ARC-AGI-3, więc bezpośrednie porównanie liderów pozostaje niemożliwe
Źródła
- VentureBeat — 'Welcome to the AGI era': OpenAI launches GPT-6 Astra
- ARC Prize — OpenAI's GPT-6 Astra on ARC-AGI-3
- Simon Willison's Weblog — GPT-6 Astra





