1) Front-end wyznacza cechy akustyczne z sygnału mowy (MFCC lub banki filtrów mel na krótkich ramkach). 2) Sieć embeddingowa (np. TDNN dla x-vectora, ECAPA-TDNN, lub DNN dla d-vectora) przetwarza sekwencję cech i przez warstwę agregacji statystyk (statistics/attentive pooling) redukuje wypowiedź o zmiennej długości do jednego stałowymiarowego embeddingu mówcy. 3) W fazie rejestracji (enrollment) tworzy się wzorzec mówcy przez uśrednienie embeddingów z jego nagrań. 4) W fazie testu embedding próbki porównuje się z wzorcem miarą podobieństwa (kosinus lub PLDA). 5) Weryfikacja: wynik porównywany z progiem daje akceptację/odrzucenie (metryka: EER); identyfikacja: wybierany jest mówca o najwyższym podobieństwie (argmax po zbiorze). Trening wykorzystuje funkcje straty klasyfikacyjne (softmax, AAM-softmax) lub metric-learningowe (GE2E, triplet), które uczą przestrzeni, w której embeddingi tego samego mówcy są blisko, a różnych mówców — daleko.
Jak automatycznie i wiarygodnie ustalić lub potwierdzić tożsamość osoby wyłącznie na podstawie próbki głosu, w warunkach zmiennego kanału, szumu i długości wypowiedzi, oraz jak zrobić to niezależnie od treści wypowiedzi.
Zamienia surowy sygnał mowy na sekwencję wektorów cech spektralnych liczonych na krótkich ramkach (zwykle 25 ms co 10 ms). Najczęściej MFCC lub banki filtrów mel.
Oficjalna
Sieć neuronowa mapująca sekwencję cech na stałowymiarowy embedding mówcy. Warianty: d-vector (DNN), x-vector (TDNN), ECAPA-TDNN (SE-Res2Net + kanałowa uwaga).
Oficjalna
Redukuje sekwencję cech o zmiennej długości do wektora o stałym rozmiarze przez agregację statystyk (średnia i odchylenie standardowe), opcjonalnie z mechanizmem uwagi.
Oficjalna
Oblicza wynik podobieństwa między embeddingiem testowym a wzorcem mówcy. Najczęściej podobieństwo kosinusowe lub PLDA (Probabilistic Linear Discriminant Analysis).
Oficjalna
Dla weryfikacji porównuje wynik z progiem (akceptacja/odrzucenie); dla identyfikacji wybiera mówcę o najwyższym podobieństwie. Metryka jakości: EER.
Oficjalna
Rozpoznawanie mówcy ustala KTO mówi, a nie CO zostało powiedziane; to odrębne zadanie od ASR.
Różnice urządzenia nagrywającego, kodeka, szumu i akustyki pomieszczenia znacząco podnoszą EER.
Systemy weryfikacji są podatne na odtworzenie nagrania, syntezę mowy i konwersję głosu.
Zbyt krótkie nagrania rejestracyjne lub testowe pogarszają jakość embeddingu i dokładność.
Jeden próg dla różnych populacji, języków czy płci może dawać nierówne FAR/FRR.
Reynolds i in. wprowadzają model mieszanin gaussowskich z uniwersalnym modelem tła jako standard weryfikacji mówcy.
Dehak i in. proponują front-end factor analysis, kodując wypowiedź jako jeden wektor o niskim wymiarze (i-vector) — początek paradygmatu embeddingowego.
Variani i in. wprowadzają embeddingi mówcy z głębokiej sieci neuronowej dla weryfikacji zależnej od tekstu.
Snyder i in. przedstawiają x-vectory — embeddingi z TDNN ze statistics pooling i augmentacją danych, przewyższające i-vectory.
Wan i in. wprowadzają Generalized End-to-End loss, poprawiając trening embeddingów mówcy.
Desplanques i in. łączą SE-Res2Blocks, agregację wielopoziomową i attentive statistics pooling, wyznaczając nowy stan wiedzy na VoxCeleb.
Złożoność czasowa: O(N · D). Złożoność przestrzenna: O(N · D).
Rozmiar wektora odcisku głosowego; typowo 128–512.
Klasyfikacyjna (softmax, AAM-softmax) lub metric-learningowa (GE2E, triplet).
Próg podobieństwa dla weryfikacji 1:1; steruje kompromisem FAR/FRR i wyznacza punkt EER.
Text-dependent (stała fraza) vs text-independent (dowolna wypowiedź).
Ilość mowy użytej do zbudowania wzorca mówcy; krótsze nagrania obniżają dokładność.
Sieć embeddingowa jest gęsta — wszystkie parametry aktywne dla każdego wejścia.
Ekstrakcja cech ramkowych oraz wyliczanie embeddingów rejestracyjnych są równoległe; porównania 1:N także trywialnie zrównoleglane.
Trening sieci embeddingowych na dużych korpusach (np. VoxCeleb) korzysta z akceleracji GPU.
Inferencja embeddingu i porównanie są lekkie i często uruchamiane na CPU, także na urządzeniach brzegowych.
Sam etap porównania embeddingów (kosinus/PLDA) jest niezależny od sprzętu.