Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

GPT-6 Astra: OpenAI ogłasza erę AGI, liczby są ostrożniejsze

Pan Robocik4 września 2026 · 3 min czytania
GPT-6 Astra: OpenAI ogłasza erę AGI, liczby są ostrożniejsze

OpenAI udostępniło 3 września GPT-6 Astra — model agentowy, który sam obsługuje przeglądarkę, arkusz i aplikacje zamiast podpowiadać, co w nich kliknąć. Greg Brockman skwitował premierę słowami „Welcome to the AGI era”. Niezależne pomiary są ostrożniejsze: model dominuje w zadaniach bezpieczeństwa, ale w ogólnym rankingu inteligencji zostaje za Claude Fable 5.1.

Najważniejsze w skrócie

  • Premiera 3 września 2026, w API jako gpt-6-astra — 10 USD za mln tokenów wejściowych i 50 USD za wyjściowych (ok. 40 i 200 zł)
  • ARC-AGI-3: 99,9% na autorskim harnessie OpenAI, 62,7% na standardowym
  • ExploitBench: 100% wobec 78,5% dla GPT-5.6 Sol
  • Intelligence Index Artificial Analysis: 61 pkt, pięć poniżej Claude Fable 5.1
  • Status Critical dla cyberbezpieczeństwa w Preparedness Framework OpenAI

Agent, który klika sam

Astra to Computer use model: Model, który steruje interfejsem komputera tak jak człowiek — klika, przewija i wpisuje w istniejących aplikacjach, zamiast zwracać sam tekst do ręcznego przeklejenia.: zamiast generować tekst do skopiowania, sam obsługuje przeglądarkę, CRM i arkusz kalkulacyjny. Rollout ruszył od wąskiej grupy organizacji w programie Daybreak i w kolejnych dniach obejmie ChatGPT Plus, Pro, Business i Enterprise, API, AWS Bedrock oraz Azure. OpenAI podaje, że trening pochłonął ponad 100 tys. DBU na infrastrukturze Stargate — największy skok w historii firmy.

Wynik zależy od harnessu

Najgłośniejsza liczba premiery wymaga gwiazdki. Jak podaje ARC Prize, Astra osiąga 99,9% na ARC-AGI-3 Semi-Private za około 19 tys. USD, ale tylko z autorskim Harness: Warstwa uruchomieniowa między modelem a benchmarkiem: decyduje, co model widzi między turami, ile stanu zachowuje i jak długa może być rozmowa. Ten sam model daje różne wyniki na różnych harnessach. Provider Adapter, który przechowuje nieprzejrzysty stan rozumowania między zapytaniami. Na standardowym harnessie wynik spada do 62,7%, a koszt rośnie do 26 tys. USD.

Poziom reasoningStandard harnessProvider Adapter
max62,7% · 26 098 USD98,6% · 17 332 USD
xhigh59,3% · 37 317 USD98,4% · 18 147 USD
high54,8% · 40 705 USD99,9% · 18 817 USD
medium38,6% · 48 090 USD98,4% · 19 285 USD
low17,5% · 38 166 USD98,0% · 21 298 USD
none35,2% · 49 791 USD96,7% · 23 457 USD
GPT-6 Astra na ARC-AGI-3 Semi-Private. Wynik i koszt zależą od harnessu bardziej niż od poziomu reasoning. Dane: ARC Prize.

Ciekawszy jest inny rezultat. Model zużył o 51,7% mniej akcji na poziom, niż wynosi mediana dla testowanych ludzi, i był oszczędniejszy na 96% poziomów. ARC Prize zastrzega przy tym, że wysycenie benchmarku nie dowodzi osiągnięcia AGI.

51,7%mniej akcji na poziom, niż wynosi mediana dla testowanych ludziARC Prize, ARC-AGI-3

Mocny w kodzie ofensywnym

Astra dominuje tam, gdzie liczy się bezpieczeństwo — 100% na ExploitBench wobec 78,5% dla GPT-5.6 Sol i 99,2% w czterech próbach na SRE-Bench przy 68,7% poprzednika. Radzi sobie też z długim kontekstem: 96,3% powyżej pół miliona tokenów. W ogólnym Intelligence Index zatrzymuje się jednak na 61 punktach, przegrywając z Fable 5.1 i Muse Spark 1.3. Wyników GDPval zabrakło w materiałach premierowych.

Dlaczego to ważne?

Premiera przesuwa punkt ciężkości z jakości pojedynczej odpowiedzi na zdolność doprowadzenia zadania do końca w cudzym oprogramowaniu. Zmienia to sposób wyceny — liczy się koszt ukończonego zadania, nie tokena. Rozbieżność między harnessami pokazuje przy tym, że wyniki benchmarków zaczynają zależeć od infrastruktury dostawcy, a nie samego modelu. Porównywanie laboratoriów staje się przez to wyraźnie trudniejsze.

Co dalej?

  • Szersza dostępność w ChatGPT Plus, Pro, Business i Enterprise oraz w AWS Bedrock i Azure ma nastąpić w ciągu kilku dni od 3 września
  • Claude Fable 5.1 nie ma opublikowanego wyniku na ARC-AGI-3, więc bezpośrednie porównanie liderów pozostaje niemożliwe

Źródła

Udostępnij ten artykuł