Pięcioro certyfikowanych tłumaczy niesłyszących (CDI) tłumaczy zdania z korpusu FLORES/FLEURS na ASL w formie wideo, dzięki czemu każde nagranie ma gotowe odniesienia tekstowe i mowy w wielu językach. Do oceny tłumaczenia na poziomie zdania rekomendowane są dwie metryki: BLEU (sacreBLEU z tokenizacją „intl") oraz BLEURT (model BLEURT-20); na poziomie dyskursu stosuje się wyłącznie BLEU (BLEURT nie jest przeznaczony do długich wyjść), a dla tłumaczenia z osią czasu — Timed BLEU (i analogicznie Timed BLEURT). Model bazowy oparto na podejściu z YouTube-ASL: enkoder-dekoder T5v1.1-Base, do którego liniowo rzutuje się 85 trójwymiarowych punktów szkieletu z MediaPipe Holistic, z 34-sekundowym oknem kontekstu oraz tokenami znaczników czasu i wcześniejszego tekstu. Benchmark obejmuje zadania: tłumaczenie na poziomie zdania i dyskursu, wyrównanie napisów, wyszukiwanie oraz receptywne rozumienie (pytania wielokrotnego wyboru).
Tłumaczenie języka migowego było historycznie marginalizowane w głównym nurcie badań nad tłumaczeniem maszynowym, a brakowało wystandaryzowanego, wielojęzycznego benchmarku obejmującego język migowy. FLEURS-ASL dostarcza porównywalnego punktu odniesienia, który pozwala rzetelnie mierzyć zdolność modeli (w tym modeli multimodalnych) do rozumienia i tłumaczenia ASL.
1749 zdań w 495 dyskursach (7,49 h wideo) nagranych przez 5 certyfikowanych tłumaczy niesłyszących (CDI).
Zdania pochodzą z FLORES/FLEURS, więc tłumaczenia ASL są sparowane z tekstem w 200 językach i mową w 102 językach.
Tłumaczenie na poziomie zdania i dyskursu, wyrównanie napisów (caption alignment), wyszukiwanie (retrieval) oraz receptywne rozumienie (pytania wielokrotnego wyboru).
BLEU (sacreBLEU, tokenizacja „intl") i BLEURT (BLEURT-20) na poziomie zdania; wyłącznie BLEU na poziomie dyskursu; Timed BLEU/BLEURT dla tłumaczenia z osią czasu.
Enkoder-dekoder T5v1.1-Base z liniowo rzutowanymi 85 punktami 3D z MediaPipe Holistic, 34-sekundowym oknem kontekstu oraz tokenami czasu i wcześniejszego tekstu; trenowany na YouTube-ASL.
Autor zaznacza, że BLEURT nie jest przeznaczony do długich sekwencji, dlatego na poziomie dyskursu należy raportować wyłącznie BLEU.
Wielojęzyczny benchmark tłumaczenia maszynowego (101 języków), podstawa tekstowych odniesień.
Rozszerzenie FLORES o mowę: Few-shot Learning Evaluation of Universal Representations of Speech (Google).
Wielkoskalowy, otwartodziedzinowy korpus ASL–angielski (~1000 h), podstawa modelu bazowego FLEURS-ASL.
Wprowadzenie ASL do masowo wielojęzycznej ewaluacji; ujawnienie, że czołowe modele multimodalne nie rozumieją ASL.