Robocikowo>ROBOCIKOWO
Dane

Gloss

2018AktywnyOpublikowano: 25 sierpnia 2026Aktualizacja: 25 sierpnia 2026Opublikowany
Glosa to zapis znak-po-znaku języka migowego słowami języka mówionego pisanymi wielkimi literami; w ML pełni rolę pośredniej reprezentacji w rozpoznawaniu i tłumaczeniu języka migowego.
Kluczowa innowacja
Wprowadził pośrednią, symboliczną reprezentację języka migowego (transkrypcję znak-po-znaku słowami języka mówionego pisanymi wielkimi literami), która pozwala trenować systemy rozpoznawania i tłumaczenia języka migowego jako zadanie sekwencja-do-sekwencji.
Kategoria
Dane
Poziom abstrakcji
Building block
Poziom operacji
DaneTreningInferencja
Zastosowania
Tłumaczenie maszynowe języka migowego (SLT)Rozpoznawanie ciągłego języka migowego (CSLR)Anotacja korpusów języka migowegoPośredni cel nadzoru (CTC) w treningu modeliBadania lingwistyczne nad językami migowymi

Jak działa

Anotator zapisuje każdy znak manualny słowem języka mówionego WIELKIMI LITERAMI w kolejności migania; elementy niemanualne i prozodię notuje jako indeksy górne z zakresem w nawiasach, literowanie palcowe łącznikami, a formy zleksykalizowane symbolem #. W potoku ML: (1) sign2gloss2text — sieć wizyjna rozpoznaje sekwencję glos z wideo (zwykle uczona funkcją CTC, bo brak wyrównania czasowego), a druga sieć tłumaczy glosy na zdanie; (2) w modelach łączonych (Sign Language Transformers) glosa służy jako pomocniczy cel nadzoru CTC obok głównego celu tłumaczenia. Ponieważ szyk glos różni się od szyku języka mówionego (niemonotoniczność), etap glosa→tekst realizuje pełne tłumaczenie sekwencja-do-sekwencji.

Rozwiązany problem

Języki migowe nie mają powszechnie przyjętej formy pisanej, a ciągłe miganie trudno wyrównać do tekstu mówionego. Glosa dostarcza dyskretnej, stokenizowanej reprezentacji pośredniego poziomu, która umożliwia nadzorowane rozpoznawanie i tłumaczenie oraz ilościową ewaluację systemów.

Komponenty

Manualny token glosy (WIELKIE LITERY)Podstawowa jednostka reprezentacji: słowo języka mówionego oznaczające znak manualny

Znak manualny zapisany słowem języka mówionego pisanym wielkimi literami, umieszczony w kolejności migania.

Znaczniki niemanualne / prozodiaKodowanie mimiki, ruchu głowy, negacji i pytań oraz ich zakresu

Notowane zwykle jako indeksy górne z zakresem oznaczonym nawiasami, np. [I LIKE]^negative.

Notacja literowania palcowegoZapis liter literowanych palcami i form zleksykalizowanych

Czyste literowanie oznaczane łącznikami (W-I-K-I); formy zleksykalizowane symbolem hash (#JOB).

Notacja przestrzenno-indeksowaOznaczanie odniesień przestrzennych i uzgodnienia (indeksowanie, IX)

Częściowe kodowanie gramatyki przestrzennej; z natury niepełne, co jest źródłem utraty informacji.

Implementacja

Pułapki implementacyjne
Utrata informacji (glosa ≠ pełny język)Wysoka

Glosa spłaszcza jednoczesność, gramatykę przestrzenną i elementy niemanualne, tworząc wąskie gardło informacyjne ograniczające jakość tłumaczenia.

Rozwiązanie:Stosuj podejścia gloss-free lub bogatszą, wielowarstwową anotację niemanualną.
Wysoki koszt anotacjiWysoka

Anotacja glosami wymaga wyszkolonych lingwistów lub natywnych osób migających; zbiory pozostają małe (rzędu 10–20 tys. par).

Rozwiązanie:Transfer learning, słaby nadzór, dane z YouTube i uczenie gloss-free.
Brak uniwersalnego standardu glosowaniaŚrednia

Konwencje różnią się między korpusami i językami migowymi, co utrudnia reprodukowalność i transfer między zbiorami.

Rozwiązanie:Dokumentuj konwencję glosowania i mapuj słowniki między korpusami.
Niemonotoniczność względem języka mówionegoŚrednia

Szyk glos różni się od szyku słów w języku mówionym, więc wyrównanie glosa→tekst jest nietrywialne.

Rozwiązanie:Realizuj etap glosa→tekst jako pełne tłumaczenie sekwencja-do-sekwencji.

Ewolucja

Oryginalny paper · 2018 · CVPR 2018 · Necati Cihan Camgöz
Neural Sign Language Translation
Necati Cihan Camgöz, Simon Hadfield, Oscar Koller, Hermann Ney, Richard Bowden
2014
Korpus RWTH-PHOENIX-Weather 2014 z anotacją glosami

Zbiór prognoz pogody niemieckiej telewizji z anotacją glosami — standardowy benchmark ciągłego rozpoznawania języka migowego.

2018
Neural Sign Language Translation wprowadza sign2gloss2text i PHOENIX-2014T
Punkt przełomowy

Camgöz i in. formalizują glosę jako reprezentację pośredniego poziomu w neuronowym tłumaczeniu języka migowego.

2020
Sign Language Transformers: glosa jako pośredni nadzór CTC

Łączone kompleksowe rozpoznawanie i tłumaczenie; glosa jako pomocniczy cel CTC drastycznie poprawia jakość tłumaczenia.

2022
Multi-modality transfer baseline (sign2gloss2text) osiąga wysokie wyniki

Chen i in. łączą sieć sign-to-gloss i gloss-to-text mapperem wizualno-językowym, dowartościowując potok glosowy transfer learningiem.

2023
GFSLT-VLP: tłumaczenie gloss-free i krytyka wąskiego gardła glos
Punkt przełomowy

Zhou i in. wskazują „wąskie gardło informacyjne" reprezentacji glosowej i deficyt danych, proponując tłumaczenie bez glos.

2024
FLEURS-ASL: gloss-free wideo-benchmark dla ASL

Rozszerza FLORES/FLEURS o amerykański język migowy jako wideo; pokazuje, że modele frontier niemal nie rozumieją ASL.

Hiperparametry (konfigurowalne osie)

Konwencja glosowaniaWysoka

Brak uniwersalnego standardu — konwencje różnią się między korpusami i językami migowymi (ASL, DGS, BSL).

Rozmiar słownika glosŚrednia

Liczba unikalnych glos w korpusie wpływa na trudność rozpoznawania i pokrycie.

Anotacja elementów niemanualnychŚrednia

Czy i jak szczegółowo notuje się mimikę, prozodię i gramatykę przestrzenną obok glos manualnych.