Kolejność działania: (1) Tokenizacja — wspólny tokenizer podwyrazowy (BPE/SentencePiece/WordPiece) budowany na połączonym korpusie wielojęzycznym, tak by fragmenty słów i alfabety były współdzielone między językami. (2) Próbkowanie danych — języki miesza się z wygładzaniem wykładniczym (temperature/alpha sampling), aby nie zdominowały ich języki high-resource i by dowartościować low-resource. (3) Pretraining — jeden wspólny backbone Transformer uczy się celu samonadzorowanego (masked LM jak w mBERT/XLM-R lub causal/seq2seq LM jak w BLOOM/mT5); opcjonalnie dodaje się cel międzyjęzykowy z danych równoległych (Translation Language Modeling w XLM). (4) Wspólna przestrzeń reprezentacji sprawia, że zbliżone znaczeniowo zdania w różnych językach mają zbliżone reprezentacje, co daje cross-lingual transfer. (5) Douczanie/dostrajanie na zadaniu w jednym języku przenosi się na inne (zero-shot cross-lingual transfer).
Modele jednojęzyczne wymagają osobnego treningu i dużych, oznaczonych zbiorów dla każdego języka, co jest nieosiągalne dla większości z ~7000 języków świata (języki low-resource). Multilingual foundation model rozwiązuje to, ucząc wspólnej reprezentacji z wielu języków naraz i przenosząc wiedzę do języków ubogich w dane, umożliwiając transfer zero-shot i few-shot bez budowania modelu per język.
Jeden tokenizer (BPE/SentencePiece/WordPiece) trenowany na korpusie wielojęzycznym; współdzielenie fragmentów słów i alfabetów między językami umożliwia transfer. mBERT używa 110k WordPiece dla 104 języków.
Oficjalna
Duża mieszanka tekstów wielojęzycznych (np. Wikipedia dla mBERT, CC-100/CommonCrawl dla XLM-R, ROOTS dla BLOOM, mC4 dla mT5) z próbkowaniem wyrównującym proporcje języków.
Oficjalna
Jeden zestaw wag Transformera (encoder, decoder lub encoder-decoder) współdzielony przez wszystkie języki; buduje wspólną przestrzeń reprezentacji odpowiedzialną za cross-lingual transfer.
Wygładzanie wykładnicze proporcji języków (parametr alpha/temperatura) upweightuje języki low-resource i ogranicza dominację high-resource, łagodząc nierównowagę danych.
Oficjalna
Opcjonalny nadzorowany cel wykorzystujący dane równoległe, np. Translation Language Modeling (TLM) z XLM, gdzie konkatenowane pary zdań uczą model bezpośrednich powiązań międzyjęzykowych.
Oficjalna
Przy stałym rozmiarze modelu dodawanie kolejnych języków w pewnym momencie obniża wydajność per język — pojemność jest rozcieńczana między języki.
Współdzielony tokenizer często dzieli teksty w językach o alfabetach niełacińskich na więcej tokenów, zwiększając koszt i pogarszając jakość dla tych języków.
Bez korekty próbkowania języki high-resource dominują trening, a języki low-resource są niedouczone.
Benchmarki obejmują ułamek języków, co utrudnia wiarygodną ocenę jakości dla języków low-resource i przecenianie transferu.
Pojedynczy Transformer trenowany na Wikipedii 104 języków ze współdzielonym słownikiem 110k WordPiece, bez celu międzyjęzykowego; wykazał zaskakujący transfer międzyjęzykowy zero-shot.
Wprowadził jawne cele międzyjęzykowe: MLM na danych jednojęzycznych oraz Translation Language Modeling (TLM) na danych równoległych, ze współdzielonym słownikiem BPE.
Skalowanie do 100 języków na ponad 2 TB danych CommonCrawl (CC-100); nazwanie kompromisu między pozytywnym transferem a rozcieńczeniem pojemności (curse of multilinguality). Duża poprawa nad mBERT (+14.6% XNLI).
Wielojęzyczny wariant T5 w formacie text-to-text, pretrenowany na Common Crawl obejmującym 101 języków; rozszerzenie paradygmatu na generację.
Stanford CRFM definiuje model fundamentowy jako trenowany na szerokich danych w skali i adaptowalny do wielu zadań — ramy pojęciowe obejmujące także modele wielojęzyczne.
Model 176B (BigScience) trenowany na korpusie ROOTS obejmującym 46 języków naturalnych i 13 programistycznych; otwarty dostęp na licencji RAIL.
Otwarty model (Cohere For AI) dostrojony instrukcyjnie do 101 języków, z których ponad 50% to języki low-resource; nacisk na niedoreprezentowane społeczności językowe.
Liczba języków w treningu; np. 104 (mBERT), 100 (XLM-R), 101 (mT5, Aya), 46 naturalnych + 13 programistycznych (BLOOM). Więcej języków = szerszy zasięg, ale ryzyko klątwy wielojęzyczności.
Rozmiar współdzielonego słownika podwyrazowego; większy słownik zmniejsza fragmentację (fertility) w językach o innych alfabetach. mBERT: 110k; XLM-R: 250k.
Parametr wygładzania wykładniczego proporcji języków; niższe alpha silniej dowartościowuje języki low-resource kosztem high-resource.
Liczba parametrów; zwiększanie pojemności łagodzi klątwę wielojęzyczności (capacity dilution) przy stałej liczbie języków.
Skład korpusu: udziały języków, domeny, jakość filtrowania oraz ewentualny udział danych równoległych.
Multilingual foundation model to paradygmat, nie konkretna architektura — tryb wykonania odzwierciedla najczęstszą realizację (gęsty Transformer, wszystkie parametry aktywne). Konkretne modele mogą używać MoE (np. warianty sparse).
Pretraining wielojęzycznych modeli fundamentowych wymaga masowej równoległości (data + model + pipeline parallelism) na klastrach akceleratorów; wielojęzyczność nie zmienia charakterystyki równoległości względem jednojęzycznego LLM.
Pretraining i inferencja gęstych Transformerów wielojęzycznych korzystają z mnożenia macierzy w formatach mieszanej precyzji na rdzeniach Tensor.
Modele takie jak mT5 trenowano na TPU; architektura Transformer dobrze mapuje się na macierzowe jednostki TPU.