Pipeline VSR zaczyna od detekcji twarzy i lokalizacji regionu zainteresowania (ROI) wokół ust, a następnie wyrównania i normalizacji sekwencji klatek. Wizualny front-end (przestrzenno-czasowa konwolucja / 3D-CNN) wydobywa cechy ruchu warg z sekwencji obrazów. Model sekwencyjny (GRU/LSTM lub Transformer/Conformer) modeluje zależności czasowe między klatkami. Dekoder mapuje sekwencję cech na tekst — przy użyciu straty CTC (dopuszczającej różne długości wejścia i wyjścia) lub architektury sequence-to-sequence z atencją. Ponieważ wiele fonemów daje ten sam kształt ust (homofeny/wizemy), model musi korzystać z kontekstu językowego. Nowsze podejścia (np. AV-HuBERT) wykorzystują samonadzorowane pretrenowanie na dużych zbiorach audio-wizualnych, aby złagodzić niedobór etykietowanych danych.
Rozpoznawanie mowy zawodzi lub jest niedostępne, gdy sygnał audio jest zaszumiony, tłumiony przez otoczenie albo w ogóle nieobecny (np. nagranie bez dźwięku, hałaśliwa hala, wiele osób mówiących naraz). VSR pozwala odzyskać treść wypowiedzi z samego obrazu warg oraz wskazać, kto aktualnie mówi, co poprawia odporność systemów rozpoznawania mowy i interakcji człowiek–robot w trudnych warunkach akustycznych.
Sieć konwolucyjna operująca na wymiarze czasowym i przestrzennym, przetwarzająca wykadrowany region ust w sekwencję reprezentacji cech.
Oficjalna
Warstwa rekurencyjna lub oparta na atencji, agregująca cechy w czasie w kontekstową reprezentację sekwencji.
Oficjalna
Moduł dekodujący: strata CTC dopuszczająca różne długości wejścia/wyjścia lub dekoder seq2seq z atencją generujący znaki/słowa.
Oficjalna
Wiele różnych fonemów daje ten sam widoczny kształt ust, co czyni odczyt wieloznacznym.
Błędna detekcja twarzy/landmarków lub niestabilne kadrowanie degradują wejście.
Zmiany warunków nagrania i cech mówcy pogarszają generalizację.
Adnotacja wideo mowy jest kosztowna, co ogranicza uczenie nadzorowane.
Publikacja audio-wizualnego korpusu GRID (Cooke i in.), standardowego benchmarku dla VSR na poziomie słów/zdań.
Pierwsze kompleksowe end-to-end VSR na poziomie zdań (przestrzenno-czasowy CNN + GRU + CTC), 95,2% dokładności na GRID.
Deep Audio-Visual Speech Recognition (Afouras i in.) — VSR na niewymuszonych nagraniach z użyciem Transformerów oraz zbiory LRS2-BBC i LRS3-TED.
Samonadzorowane uczenie przez maskowaną predykcję multimodalnych klastrów; 26,9% WER na LRS3 (433 h).
Sposób detekcji, kadrowania i wyrównania regionu ust — silnie wpływa na jakość.
Wybór front-endu i modelu sekwencyjnego (3D-CNN, Transformer, Conformer).
CTC vs sequence-to-sequence z atencją.
Ziarnistość jednostek wyjściowych rozpoznawania.
Warianty transformerowe/konformerowe trenują się równolegle po klatkach; warianty rekurencyjne są sekwencyjne w czasie.
Trening i inferencja przestrzenno-czasowych CNN oraz Transformerów na sekwencjach wideo.