Google DeepMind wypuściło 15 września Gemini 3.8 Live oraz wariant Extended Thinking — modele speech-to-speech, które rozpoznają zmianę języka w trakcie rozmowy i wykonują zadania w tle, nie przerywając mówienia. Extended Thinking zajmuje pierwsze miejsce w Speech to Speech Quality Index z wynikiem 82,6.
Najważniejsze w skrócie
- Extended Thinking: 1. miejsce w Speech to Speech Quality Index (82,6 pkt)
- Big Bench Audio: 97,7% w rozumowaniu na materiale dźwiękowym
- Zadania agentowe: 68,6% na τ-Voice i 35,1% na τ-Voice-banking
- Wykrywanie i zmiana języka w trakcie rozmowy — 97 języków
- Cały generowany dźwięk znakowany SynthID
Model, który myśli i mówi jednocześnie
Podstawowa różnica między wariantami dotyczy tego, co dzieje się w czasie wypowiedzi. Gemini 3.8 Live Extended Thinking prowadzi rozumowanie równolegle z mówieniem, zamiast zatrzymywać się na przemyślenie odpowiedzi. Oba modele wykonują wywołania narzędzi i API w tle, bez przerywania dialogu.
Rozpoznają zmianę języka w trakcie rozmowy i płynnie przechodzą na nowy — obsługiwanych jest 97 języków. Obraz przetwarzany jest niemal w czasie rzeczywistym. To klasyczny przykład speech-to-speech AI: audio wchodzi i audio wychodzi, bez pośredniej transkrypcji. Cały generowany dźwięk jest znakowany SynthID.
Co mówią benchmarki
| Test | Wynik | Co mierzy |
|---|---|---|
| Speech to Speech Quality Index | 82,6 — 1. miejsce | jakość rozmowy głosowej |
| Big Bench Audio | 97,7% | rozumowanie na materiale dźwiękowym |
| τ-Voice | 68,6% | ukończone zadania agentowe głosem |
| τ-Voice-banking | 35,1% | zadania bankowe prowadzone głosem |
Ranking Speech to Speech Quality Index prowadzi Artificial Analysis. Sam Gemini 3.8 Live zajął drugie miejsce w Speech Agent Arena. Najsłabiej wypadają zadania agentowe prowadzone głosem, zwłaszcza bankowy wariant τ-Voice od firmy Sierra.
Pierwsze wrażenia z API
Simon Willison zbudował w dniu premiery przeglądarkowy interfejs do testowania obu modeli — bez żadnych bibliotek. Łączy się przez WebSocket i używa Web Audio API do nagrywania oraz odtwarzania dźwięku. Interfejs pozwala wybrać wariant modelu, głos i prompt systemowy, a także przerwać model w trakcie mówienia.
// Endpoint dwukierunkowej sesji głosowej, z którego korzysta interfejs
const ws = new WebSocket(
'wss://generativelanguage.googleapis.com/ws/' +
'google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent'
);
// Dźwięk z mikrofonu i odtwarzanie odpowiedzi obsługuje Web Audio API —
// bez żadnej zewnętrznej biblioteki.Kod trafił do jego publicznego repozytorium narzędzi.
Dlaczego to ważne?
Wykrywanie języka w trakcie rozmowy usuwa krok, który dotąd wymagał osobnego klasyfikatora albo deklaracji użytkownika. Wywoływanie narzędzi w tle likwiduje ciszę, która zdradza, że po drugiej stronie jest maszyna. To dwie rzeczy odróżniające demo od produktu. Wynik 35,1% na bankowym τ-Voice pokazuje jednak, gdzie leży granica.
Co dalej?
- Dla programistów modele są dostępne w Gemini API i Google AI Studio
- Google DeepMind nie ujawniło cennika — komunikat mówi wyłącznie o konkurencyjnym poziomie kosztów
- Gemini Enterprise for Customer Experience zapowiedziano bez podanej daty, wersja dla firm jest w prywatnym preview
Źródła
- Google — Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
- Simon Willison — Gemini Live Audio





