Robocikowo>ROBOCIKOWO
Ocena jakości

FLEURS-ASL

2024AktywnyOpublikowano: 25 sierpnia 2026Aktualizacja: 25 sierpnia 2026Opublikowany
Benchmark ewaluacyjny rozszerzający wielojęzyczny FLEURS/FLORES o ASL: 1749 zdań w 495 dyskursach (7,49 h wideo) od 5 certyfikowanych tłumaczy niesłyszących (CDI).
Kluczowa innowacja
Pierwsze rozszerzenie masowo wielojęzycznego benchmarku FLEURS/FLORES o język migowy (amerykański język migowy, ASL), umożliwiające porównywalną ewaluację tłumaczenia wideo migowego na tekst i mowę we wszystkich językach obsługiwanych przez FLORES (200) i FLEURS (102).
Kategoria
Ocena jakości
Poziom abstrakcji
System
Poziom operacji
Ewaluacja (runtime)Dane
Zastosowania
Ewaluacja tłumaczenia ASL na tekst (sign-to-text)Benchmark rozumienia języka migowego przez modele multimodalnePorównywalna ewaluacja tłumaczenia migowego w wielu językachOcena wyrównania napisów, wyszukiwania i receptywnego rozumienia ASLBadania nad tłumaczeniem języka migowego

Jak działa

Pięcioro certyfikowanych tłumaczy niesłyszących (CDI) tłumaczy zdania z korpusu FLORES/FLEURS na ASL w formie wideo, dzięki czemu każde nagranie ma gotowe odniesienia tekstowe i mowy w wielu językach. Do oceny tłumaczenia na poziomie zdania rekomendowane są dwie metryki: BLEU (sacreBLEU z tokenizacją „intl") oraz BLEURT (model BLEURT-20); na poziomie dyskursu stosuje się wyłącznie BLEU (BLEURT nie jest przeznaczony do długich wyjść), a dla tłumaczenia z osią czasu — Timed BLEU (i analogicznie Timed BLEURT). Model bazowy oparto na podejściu z YouTube-ASL: enkoder-dekoder T5v1.1-Base, do którego liniowo rzutuje się 85 trójwymiarowych punktów szkieletu z MediaPipe Holistic, z 34-sekundowym oknem kontekstu oraz tokenami znaczników czasu i wcześniejszego tekstu. Benchmark obejmuje zadania: tłumaczenie na poziomie zdania i dyskursu, wyrównanie napisów, wyszukiwanie oraz receptywne rozumienie (pytania wielokrotnego wyboru).

Rozwiązany problem

Tłumaczenie języka migowego było historycznie marginalizowane w głównym nurcie badań nad tłumaczeniem maszynowym, a brakowało wystandaryzowanego, wielojęzycznego benchmarku obejmującego język migowy. FLEURS-ASL dostarcza porównywalnego punktu odniesienia, który pozwala rzetelnie mierzyć zdolność modeli (w tym modeli multimodalnych) do rozumienia i tłumaczenia ASL.

Komponenty

Korpus wideo CDIŹródło danych ewaluacyjnych ASL

1749 zdań w 495 dyskursach (7,49 h wideo) nagranych przez 5 certyfikowanych tłumaczy niesłyszących (CDI).

Równoległy korpus FLORES/FLEURSReferencje docelowe tłumaczenia

Zdania pochodzą z FLORES/FLEURS, więc tłumaczenia ASL są sparowane z tekstem w 200 językach i mową w 102 językach.

Zestaw zadań ewaluacyjnychDefinicja zadań benchmarku

Tłumaczenie na poziomie zdania i dyskursu, wyrównanie napisów (caption alignment), wyszukiwanie (retrieval) oraz receptywne rozumienie (pytania wielokrotnego wyboru).

Metryki ewaluacjiProtokół oceny

BLEU (sacreBLEU, tokenizacja „intl") i BLEURT (BLEURT-20) na poziomie zdania; wyłącznie BLEU na poziomie dyskursu; Timed BLEU/BLEURT dla tłumaczenia z osią czasu.

Model bazowy (T5 + MediaPipe Holistic)Wartość bazowa (baseline) benchmarku

Enkoder-dekoder T5v1.1-Base z liniowo rzutowanymi 85 punktami 3D z MediaPipe Holistic, 34-sekundowym oknem kontekstu oraz tokenami czasu i wcześniejszego tekstu; trenowany na YouTube-ASL.

Implementacja

Pułapki implementacyjne
BLEURT nieodpowiedni dla długich wyjśćŚrednia

Autor zaznacza, że BLEURT nie jest przeznaczony do długich sekwencji, dlatego na poziomie dyskursu należy raportować wyłącznie BLEU.

Rozwiązanie:Na poziomie dyskursu używaj wyłącznie BLEU; BLEURT (BLEURT-20) rezerwuj dla oceny na poziomie zdania.

Ewolucja

Oryginalny paper · 2024 · arXiv 2024 · Garrett Tanzer
FLEURS-ASL: Włączenie amerykańskiego języka migowego do masowo wielojęzycznej, wielozadaniowej ewaluacji
Garrett Tanzer
2021
FLORES-101 — wielojęzyczny benchmark tłumaczenia tekstu

Wielojęzyczny benchmark tłumaczenia maszynowego (101 języków), podstawa tekstowych odniesień.

2022
FLEURS — mowa dla 102 języków

Rozszerzenie FLORES o mowę: Few-shot Learning Evaluation of Universal Representations of Speech (Google).

2023
YouTube-ASL — korpus ASL–angielski

Wielkoskalowy, otwartodziedzinowy korpus ASL–angielski (~1000 h), podstawa modelu bazowego FLEURS-ASL.

2024
FLEURS-ASL — pierwszy język migowy w FLEURS/FLORES
Punkt przełomowy

Wprowadzenie ASL do masowo wielojęzycznej ewaluacji; ujawnienie, że czołowe modele multimodalne nie rozumieją ASL.