Robocikowo>ROBOCIKOWO
GPT-Live-1

GPT-Live-1

1 · Rodzina: GPT
Konwersacyjny model głosowy OpenAI wydany 8 lipca 2026 r., oparty na architekturze pełnego dupleksu — jednocześnie słucha i mówi. Zastępuje Advanced Voice Mode w ChatGPT dla płatnych poziomów Go, Plus i Pro. Zapytania wymagające wyszukiwania lub rozumowania deleguje do GPT-5.5 działającego w tle.
✓ Aktywny✓ Publiczny dostępModel audioModel multimodalny📁 GPT
Data premiery
8 lipca 2026
Dostęp:HostedWdrożenie:☁ Cloud

Przegląd

GPT-Live-1 to nowa generacja modeli konwersacyjnych OpenAI, uruchomiona 8 lipca 2026 r. i zastępująca Advanced Voice Mode w ChatGPT. Model wprowadza architekturę pełnego dupleksu: przetwarza wejście audio i generuje wyjście jednocześnie, podejmując decyzje o mówieniu, słuchaniu, pauzowaniu lub przerwaniu wiele razy na sekundę. Użytkownik może wchodzić w słowo i zawieszać głos bez sztywnego rytmu przerywanych tur, a model potwierdza aktywne słuchanie krótkimi wtrąceniami typu „mhmm" czy „tak".

Kluczowym elementem architektury jest separacja między modelem głosowym a modelem wnioskowania: gdy pytanie wymaga wyszukiwania w sieci lub głębszego rozumowania, GPT-Live-1 deleguje je do GPT-5.5 działającego w tle, kontynuując rozmowę. Użytkownik może wybrać poziom rozumowania Instant, Medium lub High. GPT-Live-1 jest domyślnym modelem ChatGPT Voice dla płatnych poziomów Go, Plus i Pro (dla poziomu Free domyślny jest GPT-Live-1 mini). W ChatGPT dostępnych jest dziewięć zremasterowanych, predefiniowanych głosów, a system posiada dedykowane zabezpieczenia głosowe opisane w System Card.

Na starcie GPT-Live-1 nie obsługuje wideo ani udostępniania ekranu i nie jest jeszcze dostępny przez API — OpenAI zapowiedziało publiczne udostępnienie developerom w kolejnych miesiącach. Niektóre języki (np. hindi w wersji demo) mogą brzmieć nienaturalnie.

Klasyfikacja
Model audioModel multimodalny
Rodzina: GPT
Dostęp i wdrożenie
Hostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
Narzędzia
📥 Wejście: tekst, audio

Specyfikacja techniczna

Licencja
Proprietary
Funkcje:Używanie narzędzi
Modalności
⬇ Wejście (Input)
textaudio
⬆ Wyjście (Output)
textaudio

Możliwości i zastosowania

Natywne możliwości modelu
Konwersacja głosowa
Zdolność prowadzenia wieloturowych rozmów głosowych w czasie rzeczywistym z zachowaniem kontekstu i naturalnym tempem wypowiedzi.
Kategoria: speech
Mowa na tekst
Zdolność modelu do transkrypcji mowy do postaci tekstowej.
Kategoria: speech
Tekst na mowę
Zdolność modelu do generowania mowy na podstawie tekstu.
Kategoria: speech
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Transkrypcja strumieniowa
Konwersja mowy na tekst w czasie rzeczywistym z natychmiastowym wyprowadzaniem wyników w trakcie trwania wypowiedzi.
Kategoria: speech
Tłumaczenie na żywo
Tłumaczenie mowy w czasie rzeczywistym między wieloma językami bez przerywania strumienia audio.
Kategoria: speech
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language

Wyniki benchmarków

3 benchmarki
GPQA
accuracy · GPT-Live-1 substantially outperforms Advanced Voice Mode; exact score not publicly disclosed by OpenAI.
📄 OpenAI blog — Introducing GPT-Live
Test rozumowania eksperckiego w biologii, chemii i fizyce. OpenAI opublikował wyłącznie porównanie wykresu bez surowej liczby.
BrowseComp
accuracy · Wynik lepszy niż Advanced Voice Mode; konkretna liczba niepublikowana.
📄 OpenAI blog — Introducing GPT-Live
Test agentowego wyszukiwania w sieci i znajdywania trudno dostępnych informacji.
τ³-Voice Telecom (internal variant)
task success · GPT-Live-1 outperforms Advanced Voice Mode; wynik liczbowy nie został ujawniony.
📄 OpenAI blog — Introducing GPT-Live
Realistyczne, wielotorowe scenariusze wsparcia telecom prowadzone głosem. Wariant zmodyfikowany przez OpenAI (customized user model).

Cennik

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)

Wdrożenie i bezpieczeństwo

🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise

Publicznie dostępny System Card opisujący ocenę bezpieczeństwa GPT-Live, w tym testy natywne dla audio (samookaleczenie, psychoza, poleganie emocjonalne, przemoc, treści seksualne), red-teaming ryzyk unikalnych dla głosu oraz zabezpieczenia real-time (przekierowanie na bezpieczną odpowiedź, zakończenie rozmowy w sytuacjach wysokiego ryzyka, wsparcie kryzysowe).

Model nie potrafi imitować głosów rzeczywistych osób — używa 9 predefiniowanych głosów. Osobne zabezpieczenia dla nastolatków (Parental Controls, powiadomienia rodziców w sytuacjach ryzyka samookaleczenia).
Aktualizacja: 8 lip 2026↗ Dokumentacja security