Robocikowo>ROBOCIKOWO
Sign-Language-to-Text (SL2T)

Sign-Language-to-Text (SL2T)

1.0 · Rodzina: SL2T
Model Google DeepMind tłumaczący amerykański język migowy (ASL) na tekst angielski, wdrożony w Gboard i Live Transcribe.
✓ Aktywny✓ Publiczny dostępModel multimodalnyWyspecjalizowane AI📁 SL2T
Data premiery
12 sierpnia 2026
Dostęp:HostedWdrożenie:☁ Cloud📱 Na urządzeniu

Przegląd

Sign-Language-to-Text (SL2T) to model tłumaczenia maszynowego opracowany przez zespół Sign Language w Google DeepMind. Pierwsza wersja, SL2T 1.0, została ujawniona 12 sierpnia 2026 roku i tłumaczy amerykański język migowy (ASL) na tekst w języku angielskim.

Model jest siecią opartą na architekturze transformer, która warunkuje się na sekwencji ruchów osoby migającej i generuje tłumaczenie tekstowe autoregresywnie. Wejściem nie jest surowy obraz z kamery, lecz sekwencja współrzędnych 130 punktów kluczowych (pose landmarks) twarzy, dłoni i ciała, wyodrębnianych klatka po klatce za pomocą MediaPipe Holistic. Model był trenowany na ponad 100 000 godzin nagrań w ponad 50 językach migowych, z czego około jedna czwarta danych dotyczyła ASL.

Wdrożenie i prywatność

Przetwarzanie wideo odbywa się na urządzeniu użytkownika, po czym nagranie jest natychmiast usuwane — na serwery Google trafia wyłącznie abstrakcyjna reprezentacja punktów kluczowych. Model działa w trybie hybrydowym: detekcja pozy na urządzeniu i tłumaczenie po stronie serwera. SL2T 1.0 jest dostępny początkowo na telefonach Pixel 11 w aplikacjach Gboard (dyktowanie tekstu) i Live Transcribe (odpowiedzi w rozmowie) i jest obecnie bezpłatny.

Nadzór (AISLAC)

Wdrożenie jest nadzorowane przez AI Sign Language Advisory Committee (AISLAC) — komitet doradczy zwołany przez Google, skupiający organizacje społeczności Głuchych, instytucje akademickie i tłumaczy (m.in. National Association of the Deaf, RIT/NTID, DPAN i World Federation of the Deaf). Zespół Google DeepMind i AISLAC współtworzyli „Joint Impact Report for SL2T 1.0", opisujący możliwości i ograniczenia modelu. Zastosowania wysokiego ryzyka (medyczne, prawne, akademickie oraz rozmowy wieloosobowe) są wyraźnie poza zakresem tej wersji.

Klasyfikacja
Model multimodalnyWyspecjalizowane AI
Rodzina: SL2T
Dostęp i wdrożenie
Hostowane
ChmuraNa urządzeniu
Wagi: Zamknięte
Kluczowe parametry
📥 Wejście: wideo

Specyfikacja techniczna

Modalności
⬇ Wejście (Input)
video
⬆ Wyjście (Output)
text

Możliwości i zastosowania

Natywne możliwości modelu
Tłumaczenie na żywo
Tłumaczenie mowy w czasie rzeczywistym między wieloma językami bez przerywania strumienia audio.
Kategoria: speech
Wielojęzyczność
Kompetencje w wielu językach naturalnych (od kilku do stu+): rozumienie, generowanie, tłumaczenie, code-switching w obrębie jednej rozmowy. Modele frontier obsługują szeroki wachlarz języków ze zbliżoną jakością.
Kategoria: language
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding

Wyniki benchmarków

4 benchmarki
FLEURS-ASL (sd-test)
BLEURT · zero-shot
70 (BLEU 25)
📅 12 sie 2026📄 AISLAC Joint Impact Report for SL2T 1.0
ASL→English, zero-shot.
FLEURS-ASL (1-handed)
BLEURT · zero-shot
74 (BLEU 32)
📅 12 sie 2026📄 AISLAC Joint Impact Report for SL2T 1.0
Jednoręczne miganie / one-handed signing.
PRESTO-ASL
BLEURT · zero-shot
85 (BLEU 67)
📅 12 sie 2026📄 AISLAC Joint Impact Report for SL2T 1.0
ASL→English.
FSboard
accuracy (exact match)
64%
📅 12 sie 2026📄 AISLAC Joint Impact Report for SL2T 1.0
Fingerspelling board.

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)

Wdrożenie i bezpieczeństwo

🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise

Wideo jest przetwarzane i usuwane na urządzeniu; na serwer trafia wyłącznie abstrakcyjna reprezentacja punktów kluczowych (pose landmarks), co ogranicza dane biometryczne i kontekst otoczenia.

Aktualizacja: 24 sie 2026↗ Dokumentacja security