Sygnał tego samego źródła dociera do poszczególnych mikrofonów z różnym opóźnieniem, zależnym od geometrii macierzy i kierunku źródła. W metodach TDOA szacuje się te opóźnienia między parami mikrofonów, najczęściej maksymalizując GCC-PHAT (korelację wzajemną z wybieleniem widma fazowego, odporną na pogłos), a następnie z geometrii macierzy wyznacza kąt/pozycję. W SRP-PHAT przeszukuje się siatkę kandydujących kierunków, sumując „ukierunkowaną" moc sygnału i wybierając maksimum. MUSIC buduje macierz kowariancji sygnałów, dzieli przestrzeń na podprzestrzeń sygnału i szumu przez dekompozycję własną, a piki pseudo-widma (ortogonalność wektorów sterujących do podprzestrzeni szumu) wskazują kierunki. Podejścia uczenia głębokiego podają na wejście fazę i amplitudę widm wszystkich kanałów, a sieć CNN/CRNN uczy się mapować je bezpośrednio na azymut i elewację (regresja lub klasyfikacja po siatce kątów).
Mikrofon rejestruje tylko amplitudę dźwięku w czasie, nie jego kierunek. SSL rozwiązuje problem odzyskania informacji przestrzennej (skąd dochodzi dźwięk) z wielu strumieni audio, co jest niezbędne, by maszyna mogła zorientować się w otoczeniu akustycznym, wyodrębnić mówiącego z tła i skierować na niego uwagę.
Zbiór wielu mikrofonów rozmieszczonych w znanej geometrii (liniowej, kołowej, sferycznej). Różnice czasu/fazy między kanałami są surowcem dla wszystkich metod SSL. Więcej mikrofonów zwiększa rozdzielczość i odporność.
Uogólniona korelacja wzajemna z transformatą fazową. Wybiela widmo (normalizuje amplitudę, zostawia fazę), przez co ostry pik korelacji odpowiada opóźnieniu między parą mikrofonów nawet w pogłosie. Podstawa metod TDOA.
Oficjalna
Sterowana moc odpowiedzi z transformatą fazową. Przeszukuje siatkę kandydujących kierunków/pozycji, dla każdej sumuje ważone fazowo korelacje wszystkich par mikrofonów i wybiera maksimum globalne. Odporna na pogłos, kosztowna obliczeniowo.
Oficjalna
Multiple Signal Classification. Buduje macierz kowariancji, dzieli ją na podprzestrzeń sygnału i szumu przez dekompozycję własną; piki pseudo-widma (ortogonalność wektorów sterujących do podprzestrzeni szumu) wskazują kierunki. Wysoka rozdzielczość, wymaga znajomości liczby źródeł.
Oficjalna
Sieć CNN/CRNN przyjmująca amplitudę i fazę widm wszystkich kanałów i ucząca się mapować je bezpośrednio na azymut/elewację. Lepiej radzi sobie z pogłosem i wieloma źródłami niż metody klasyczne; wymaga danych treningowych.
Oficjalna
Odbicia od ścian tworzą pozorne źródła i rozmywają piki korelacji, obniżając dokładność. PHAT łagodzi problem, ale nie eliminuje go całkowicie.
Nakładające się źródła utrudniają przypisanie pików; MUSIC wymaga znajomości ich liczby, a metody TDOA mogą mylić źródła.
Zbyt duże odstępy mikrofonów powodują aliasing przestrzenny; macierze liniowe nie rozróżniają przodu od tyłu.
Knapp i Carter formalizują rodzinę estymatorów GCC z ważeniem fazowym (PHAT), fundament metod TDOA.
R. O. Schmidt publikuje MUSIC w IEEE Trans. Antennas and Propagation, umożliwiając wysokorozdzielczą estymację DOA dla wielu źródeł.
J. DiBiase (rozprawa doktorska, Brown University) wprowadza SRP-PHAT do lokalizacji mówcy w pomieszczeniach z pogłosem.
Sieci CNN/CRNN (m.in. DOAnet, Adavanne i in.) estymują DOA bezpośrednio z widm wielokanałowych, poprawiając odporność na pogłos.
Adavanne i in. łączą detekcję zdarzeń akustycznych z estymacją DOA w jednej sieci CRNN, inicjując zadanie SELD (i wyzwanie DCASE).
Złożoność czasowa: O(G · M²). Złożoność przestrzenna: O(M² + G).
W metodach steered-response głównym kosztem jest ewaluacja mocy dla gęstej siatki kandydatów; w MUSIC — dekompozycja własna. W podejściach DNN — inferencja sieci.
Więcej mikrofonów zwiększa rozdzielczość kątową i liczbę rozróżnialnych źródeł, ale podnosi koszt i złożoność.
Układ mikrofonów (liniowy, kołowy, sferyczny) determinuje pokrycie azymutu/elewacji i ewentualne niejednoznaczności (front-back).
Gęstość siatki kandydujących kierunków w metodach steered-response — kompromis między dokładnością a kosztem obliczeniowym.
Metody podprzestrzeni (MUSIC) wymagają znajomości/oszacowania liczby aktywnych źródeł; błąd degraduje wynik.
Klasyczne metody przetwarzają wszystkie kanały i punkty siatki; brak routingu warunkowego.
Obliczenia dla poszczególnych punktów siatki kierunków i par mikrofonów są niezależne, więc SRP-PHAT dobrze się zrównolegla. Estymacja DNN korzysta z równoległości GPU.
Klasyczne metody (GCC-PHAT, SRP-PHAT, MUSIC) opierają się na FFT i algebrze macierzowej dobrze zwektoryzowanej na CPU; działają w czasie rzeczywistym na wbudowanych procesorach robota.
Podejścia uczenia głębokiego (CNN/CRNN) do estymacji DOA korzystają z akceleracji GPU zarówno w treningu, jak i w inferencji.