Multimodalny duży model językowy OpenAI z marca 2023, następca GPT-3.5. Przyjmuje tekst i obrazy, generuje tekst. Wagi zamknięte, dostęp przez API i (dawniej) ChatGPT.
Okno kontekstowe
8K (wariant 32K)
tokenów
Parametry
Nieujawnione
parametrów
Data premiery
14 marca 2023
Dostęp:APIHostedWdrożenie:☁ Cloud
Przegląd
Zastosowania
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: 8K (wariant 32K)
🧩 Parametry: Nieujawnione
✓ Narzędzia
📥 Wejście: tekst, obraz
Platformy
Specyfikacja techniczna
Okno kontekstowe
8K (wariant 32K)
tokenów
Parametry
Nieujawnione
parametrów
Knowledge cutoff
1 wrz 2021
Data graniczna wiedzy
Licencja
Proprietary (zamknięta)
Wymagania sprzętowe
Model zamknięty, dostępny wyłącznie jako usługa w chmurze (OpenAI API, Azure OpenAI). Brak lokalnego wdrożenia.
Funkcje:✓ Używanie narzędzi
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
textcode
Możliwości i zastosowania
Natywne możliwości modelu
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie multimodalne
Zdolność modelu do łączenia i interpretowania informacji z więcej niż jednej modalności, np. tekstu i obrazu.
Kategoria: multimodal
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Rozumowanie matematyczne
Zdolność modelu do rozwiązywania zadań matematycznych wymagających wieloetapowego rozumowania — równania, dowody, kombinatoryka, geometria, rachunek różniczkowy, zadania konkursowe.
Kategoria: reasoning
Wywoływanie funkcji
Natywne wsparcie dla ustrukturyzowanego wykorzystania narzędzi, umożliwiające przepływy pracy oparte na agentach.
Kategoria: planning
Wyniki benchmarków
5 benchmarków
MMLU
accuracy · 5-shot
86.4%
📄 GPT-4 Technical Report (OpenAI, 2023)
HumanEval
pass@1 · zero-shot
67.0%
📄 GPT-4 Technical Report (OpenAI, 2023)
GSM8K
accuracy · 5-shot, chain-of-thought
92.0%
📄 GPT-4 Technical Report (OpenAI, 2023)
HellaSwag
accuracy · 10-shot
95.3%
📄 GPT-4 Technical Report (OpenAI, 2023)
DROP
f1 · 3-shot
80.9
📄 GPT-4 Technical Report (OpenAI, 2023)
Cennik
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)
Wdrożenie i bezpieczeństwo
☁ Dostępny na platformach
🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise
Dostępny w wariancie enterprise przez Azure OpenAI oraz OpenAI z opcjami dla firm (kontrola danych, brak treningu na danych API domyślnie).
Dane przesyłane przez API nie są domyślnie używane do trenowania modeli. Wdrożenia enterprise dostępne m.in. przez Azure OpenAI z certyfikacjami zgodności platformy.
Aktualizacja: 10 wrz 2026↗ Dokumentacja security
Źródła i powiązane strony
3 źródła
