Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Gemini 3.8 Live: rozmowa w 97 językach i myślenie w trakcie mówienia

Pan Robocik22 września 2026 · 2 min czytania
Gemini 3.8 Live: rozmowa w 97 językach i myślenie w trakcie mówienia

Google DeepMind wypuściło 15 września Gemini 3.8 Live oraz wariant Extended Thinking — modele speech-to-speech, które rozpoznają zmianę języka w trakcie rozmowy i wykonują zadania w tle, nie przerywając mówienia. Extended Thinking zajmuje pierwsze miejsce w Speech to Speech Quality Index z wynikiem 82,6.

Najważniejsze w skrócie

  • Extended Thinking: 1. miejsce w Speech to Speech Quality Index (82,6 pkt)
  • Big Bench Audio: 97,7% w rozumowaniu na materiale dźwiękowym
  • Zadania agentowe: 68,6% na τ-Voice i 35,1% na τ-Voice-banking
  • Wykrywanie i zmiana języka w trakcie rozmowy — 97 języków
  • Cały generowany dźwięk znakowany SynthID

Model, który myśli i mówi jednocześnie

Podstawowa różnica między wariantami dotyczy tego, co dzieje się w czasie wypowiedzi. Gemini 3.8 Live Extended Thinking prowadzi rozumowanie równolegle z mówieniem, zamiast zatrzymywać się na przemyślenie odpowiedzi. Oba modele wykonują wywołania narzędzi i API w tle, bez przerywania dialogu.

Rozpoznają zmianę języka w trakcie rozmowy i płynnie przechodzą na nowy — obsługiwanych jest 97 języków. Obraz przetwarzany jest niemal w czasie rzeczywistym. To klasyczny przykład speech-to-speech AI: audio wchodzi i audio wychodzi, bez pośredniej transkrypcji. Cały generowany dźwięk jest znakowany SynthID.

97 językówrozpoznawanych i przełączanych w trakcie trwającej rozmowy, bez deklaracji użytkownikaGoogle, 15 września 2026

Co mówią benchmarki

TestWynikCo mierzy
Speech to Speech Quality Index82,6 — 1. miejscejakość rozmowy głosowej
Big Bench Audio97,7%rozumowanie na materiale dźwiękowym
τ-Voice68,6%ukończone zadania agentowe głosem
τ-Voice-banking35,1%zadania bankowe prowadzone głosem
Gemini 3.8 Live — wyniki podane przez Google

Ranking Speech to Speech Quality Index prowadzi Artificial Analysis. Sam Gemini 3.8 Live zajął drugie miejsce w Speech Agent Arena. Najsłabiej wypadają zadania agentowe prowadzone głosem, zwłaszcza bankowy wariant τ-Voice od firmy Sierra.

Pierwsze wrażenia z API

Simon Willison zbudował w dniu premiery przeglądarkowy interfejs do testowania obu modeli — bez żadnych bibliotek. Łączy się przez WebSocket i używa Web Audio API do nagrywania oraz odtwarzania dźwięku. Interfejs pozwala wybrać wariant modelu, głos i prompt systemowy, a także przerwać model w trakcie mówienia.

JavaScript
// Endpoint dwukierunkowej sesji głosowej, z którego korzysta interfejs
const ws = new WebSocket(
  'wss://generativelanguage.googleapis.com/ws/' +
  'google.ai.generativelanguage.v1alpha.GenerativeService.BidiGenerateContent'
);

// Dźwięk z mikrofonu i odtwarzanie odpowiedzi obsługuje Web Audio API —
// bez żadnej zewnętrznej biblioteki.

Kod trafił do jego publicznego repozytorium narzędzi.

Dlaczego to ważne?

Wykrywanie języka w trakcie rozmowy usuwa krok, który dotąd wymagał osobnego klasyfikatora albo deklaracji użytkownika. Wywoływanie narzędzi w tle likwiduje ciszę, która zdradza, że po drugiej stronie jest maszyna. To dwie rzeczy odróżniające demo od produktu. Wynik 35,1% na bankowym τ-Voice pokazuje jednak, gdzie leży granica.

Co dalej?

  • Dla programistów modele są dostępne w Gemini API i Google AI Studio
  • Google DeepMind nie ujawniło cennika — komunikat mówi wyłącznie o konkurencyjnym poziomie kosztów
  • Gemini Enterprise for Customer Experience zapowiedziano bez podanej daty, wersja dla firm jest w prywatnym preview

Źródła

Udostępnij ten artykuł