Flagowy model OpenAI z rodziny GPT, następca GPT-5.6 Sol, ukierunkowany na obsługę komputera, programowanie i rozumowanie. Zapowiedziany 4 września 2026.
Data premiery
4 września 2026
Dostęp:APIHostedWdrożenie:☁ Cloud
Przegląd
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📥 Wejście: tekst, obraz
Specyfikacja techniczna
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
textcode
Możliwości i zastosowania
Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Zaawansowane rozumowanie
Zdolność do wieloetapowego, ustrukturyzowanego rozumowania: analiza problemów, planowanie kroków, wnioskowanie na podstawie hipotez. Modele reasoning-first (np. GPT-5.1 Thinking) dedykują część inferencji na łańcuchy myślowe zanim udzielą odpowiedzi.
Kategoria: reasoning
Rozumowanie wieloetapowe
Prowadzenie wieloetapowego toku rozumowania w długich, złożonych zadaniach.
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Kodowanie agentowe
Wielogodzinne, wieloetapowe zadania programistyczne wykonywane samodzielnie przez model: klonowanie repozytorium, uruchamianie testów, iteracja poprawek, integracja z narzędziami CLI. Charakterystyczne dla wariantów Codex (GPT-5.1-Codex-Mini, Codex-Max).
Kategoria: coding
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning
Obsługa komputera
Zdolność modelu do obsługi interfejsu komputera poprzez interpretację zrzutów ekranu oraz generowanie akcji takich jak kliknięcia, wpisywanie tekstu i nawigacja po aplikacjach.
Kategoria: planning
Przeglądanie internetu
Zdolność modelu do samodzielnego wyszukiwania i przeglądania stron internetowych w celu pozyskania aktualnych informacji.
Kategoria: other
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Cyberbezpieczeństwo
Zdolność modelu do zadań z zakresu bezpieczeństwa komputerowego: analizy podatności, generowania exploitów proof-of-concept, łatania luk i odpowiadania na pytania z cyberbezpieczeństwa.
Kategoria: other
Wykrywanie podatności
Zdolność do identyfikowania i analizowania luk bezpieczeństwa w kodzie źródłowym i oprogramowaniu.
Kategoria: coding
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Wieloetapowe wykonywanie projektów
Zdolność samodzielnego prowadzenia wielogodzinnych, wielokrokowych projektów: dekomponowanie zadania, planowanie sekwencji działań, iteracyjne dostarczanie wyników, korekta na podstawie feedbacku. Kluczowa dla agentów enterprise i knowledge work.
Kategoria: planning
Wyniki benchmarków
5 benchmarków
EpochAI Frontier Math
accuracy · FrontierMath Tier 4
97.6%
📅 4 wrz 2026📄 Oficjalna strona OpenAI
GPT-5.6 Sol: 83%.
ARC-AGI-3
accuracy
99.9%
📅 4 wrz 2026📄 Oficjalna strona OpenAI
ExploitBench
accuracy
100%
📅 4 wrz 2026📄 Oficjalna strona OpenAI
OSWorld
accuracy · OSWorld 2.0
72.6%
📅 4 wrz 2026📄 Oficjalna strona OpenAI
DeepSWE v1.1
accuracy
74.1%
📅 4 wrz 2026📄 Oficjalna strona OpenAI
Cennik
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)
Wdrożenie i bezpieczeństwo
🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise
OpenAI deklaruje monitoring niezgodności (misalignment) w produkcji, automatyczne systemy wykrywania niebezpiecznych zachowań oraz wzmocnione zabezpieczenia w obszarze cyberbezpieczeństwa.
Według OpenAI model w 0% przypadków wykraczał poza autoryzowany zakres działania (wobec 48% u poprzednich modeli).
Aktualizacja: 4 wrz 2026↗ Dokumentacja security
