Konwersacyjny model głosowy OpenAI wydany 8 lipca 2026 r., oparty na architekturze pełnego dupleksu — jednocześnie słucha i mówi. Zastępuje Advanced Voice Mode w ChatGPT dla płatnych poziomów Go, Plus i Pro. Zapytania wymagające wyszukiwania lub rozumowania deleguje do GPT-5.5 działającego w tle.
Data premiery
8 lipca 2026
Dostęp:HostedWdrożenie:☁ Cloud
Przegląd
Zastosowania
Dostęp i wdrożenie
Hostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
✓ Narzędzia
📥 Wejście: tekst, audio
Specyfikacja techniczna
Licencja
Proprietary
Funkcje:✓ Używanie narzędzi
Modalności
⬇ Wejście (Input)
textaudio
⬆ Wyjście (Output)
textaudio
Możliwości i zastosowania
Natywne możliwości modelu
Konwersacja głosowa
Zdolność prowadzenia wieloturowych rozmów głosowych w czasie rzeczywistym z zachowaniem kontekstu i naturalnym tempem wypowiedzi.
Kategoria: speech
Mowa na tekst
Zdolność modelu do transkrypcji mowy do postaci tekstowej.
Kategoria: speech
Tekst na mowę
Zdolność modelu do generowania mowy na podstawie tekstu.
Kategoria: speech
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Transkrypcja strumieniowa
Konwersja mowy na tekst w czasie rzeczywistym z natychmiastowym wyprowadzaniem wyników w trakcie trwania wypowiedzi.
Kategoria: speech
Tłumaczenie na żywo
Tłumaczenie mowy w czasie rzeczywistym między wieloma językami bez przerywania strumienia audio.
Kategoria: speech
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Dziedziny zastosowań
Wyniki benchmarków
3 benchmarki
GPQA
accuracy · GPT-Live-1 substantially outperforms Advanced Voice Mode; exact score not publicly disclosed by OpenAI.
📄 OpenAI blog — Introducing GPT-Live
Test rozumowania eksperckiego w biologii, chemii i fizyce. OpenAI opublikował wyłącznie porównanie wykresu bez surowej liczby.
BrowseComp
accuracy · Wynik lepszy niż Advanced Voice Mode; konkretna liczba niepublikowana.
📄 OpenAI blog — Introducing GPT-Live
Test agentowego wyszukiwania w sieci i znajdywania trudno dostępnych informacji.
τ³-Voice Telecom (internal variant)
task success · GPT-Live-1 outperforms Advanced Voice Mode; wynik liczbowy nie został ujawniony.
📄 OpenAI blog — Introducing GPT-Live
Realistyczne, wielotorowe scenariusze wsparcia telecom prowadzone głosem. Wariant zmodyfikowany przez OpenAI (customized user model).
Cennik
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)
Wdrożenie i bezpieczeństwo
🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise
Publicznie dostępny System Card opisujący ocenę bezpieczeństwa GPT-Live, w tym testy natywne dla audio (samookaleczenie, psychoza, poleganie emocjonalne, przemoc, treści seksualne), red-teaming ryzyk unikalnych dla głosu oraz zabezpieczenia real-time (przekierowanie na bezpieczną odpowiedź, zakończenie rozmowy w sytuacjach wysokiego ryzyka, wsparcie kryzysowe).
Model nie potrafi imitować głosów rzeczywistych osób — używa 9 predefiniowanych głosów. Osobne zabezpieczenia dla nastolatków (Parental Controls, powiadomienia rodziców w sytuacjach ryzyka samookaleczenia).
Aktualizacja: 8 lip 2026↗ Dokumentacja security
