Robocikowo>ROBOCIKOWO
Obsługa wielu formatów danych

Full-Duplex Voice

Architektura głosowa, w której model jednocześnie słucha i mówi — przetwarza wejście audio i generuje wyjście równolegle, podejmując wiele razy na sekundę decyzje o mowie, ciszy, pauzie lub przerwaniu.
Kategoria
Obsługa wielu formatów danych
Poziom abstrakcji
Paradygmat
Poziom operacji
ModelSystemInferencja
Zastosowania
Konwersacyjni asystenci głosowiNauka języków obcychTłumaczenie na żywoObsługa klienta głosemInterfejsy hands-free w samochodach i urządzeniach mobilnych

Jak działa

Model utrzymuje ciągły strumień wejścia audio i ciągły strumień wyjścia audio. Warstwa decyzyjna kilkadziesiąt razy na sekundę wybiera jedną z akcji: mów, słuchaj, pauzuj, przerwij, wywołaj narzędzie. Deep-work zapytania (wyszukiwanie w sieci, wieloetapowe rozumowanie) są przekazywane do modelu rozumującego w tle (np. GPT-5.5), którego odpowiedź jest wplatana w rozmowę bez przerywania jej rytmu. Model utrzymuje wewnętrzny stan tempa, głośności, tonu użytkownika oraz szumu tła, żeby odróżnić realne końce tur od chwilowego namysłu.

Rozwiązany problem

Rozwiązuje sztywność interakcji głosowych opartych na turach: długie pauzy, przerywania w nienaturalnych momentach, wysoką latencję pipeline'u STT → LLM → TTS oraz trudność w prowadzeniu naturalnej rozmowy z aktywnym słuchaniem.