FLEURS-ASL
Jak działa
Pięcioro certyfikowanych tłumaczy niesłyszących (CDI) tłumaczy zdania z korpusu FLORES/FLEURS na ASL w formie wideo, dzięki czemu każde nagranie ma gotowe odniesienia tekstowe i mowy w wielu językach. Do oceny tłumaczenia na poziomie zdania rekomendowane są dwie metryki: BLEU (sacreBLEU z tokenizacją „intl") oraz BLEURT (model BLEURT-20); na poziomie dyskursu stosuje się wyłącznie BLEU (BLEURT nie jest przeznaczony do długich wyjść), a dla tłumaczenia z osią czasu — Timed BLEU (i analogicznie Timed BLEURT). Model bazowy oparto na podejściu z YouTube-ASL: enkoder-dekoder T5v1.1-Base, do którego liniowo rzutuje się 85 trójwymiarowych punktów szkieletu z MediaPipe Holistic, z 34-sekundowym oknem kontekstu oraz tokenami znaczników czasu i wcześniejszego tekstu. Benchmark obejmuje zadania: tłumaczenie na poziomie zdania i dyskursu, wyrównanie napisów, wyszukiwanie oraz receptywne rozumienie (pytania wielokrotnego wyboru).
Rozwiązany problem
Tłumaczenie języka migowego było historycznie marginalizowane w głównym nurcie badań nad tłumaczeniem maszynowym, a brakowało wystandaryzowanego, wielojęzycznego benchmarku obejmującego język migowy. FLEURS-ASL dostarcza porównywalnego punktu odniesienia, który pozwala rzetelnie mierzyć zdolność modeli (w tym modeli multimodalnych) do rozumienia i tłumaczenia ASL.
Komponenty
1749 zdań w 495 dyskursach (7,49 h wideo) nagranych przez 5 certyfikowanych tłumaczy niesłyszących (CDI).
Zdania pochodzą z FLORES/FLEURS, więc tłumaczenia ASL są sparowane z tekstem w 200 językach i mową w 102 językach.
Tłumaczenie na poziomie zdania i dyskursu, wyrównanie napisów (caption alignment), wyszukiwanie (retrieval) oraz receptywne rozumienie (pytania wielokrotnego wyboru).
BLEU (sacreBLEU, tokenizacja „intl") i BLEURT (BLEURT-20) na poziomie zdania; wyłącznie BLEU na poziomie dyskursu; Timed BLEU/BLEURT dla tłumaczenia z osią czasu.
Enkoder-dekoder T5v1.1-Base z liniowo rzutowanymi 85 punktami 3D z MediaPipe Holistic, 34-sekundowym oknem kontekstu oraz tokenami czasu i wcześniejszego tekstu; trenowany na YouTube-ASL.
Implementacja
Autor zaznacza, że BLEURT nie jest przeznaczony do długich sekwencji, dlatego na poziomie dyskursu należy raportować wyłącznie BLEU.
Ewolucja
Wielojęzyczny benchmark tłumaczenia maszynowego (101 języków), podstawa tekstowych odniesień.
Rozszerzenie FLORES o mowę: Few-shot Learning Evaluation of Universal Representations of Speech (Google).
Wielkoskalowy, otwartodziedzinowy korpus ASL–angielski (~1000 h), podstawa modelu bazowego FLEURS-ASL.
Wprowadzenie ASL do masowo wielojęzycznej ewaluacji; ujawnienie, że czołowe modele multimodalne nie rozumieją ASL.