Robocikowo>ROBOCIKOWO
Trening

Sample-Efficient Pretraining

2023BadawczyOpublikowano: 25 sierpnia 2026Aktualizacja: 25 sierpnia 2026Opublikowany
Podejście do pretreningu modeli językowych nastawione na wysoką jakość przy małej ilości danych (~10–100 mln słów), zamiast skalowania na miliardach lub bilionach tokenów.
Kluczowa innowacja
Przeniesienie celu pretreningu z maksymalizacji skali danych na maksymalizację jakości modelu przy budżecie danych porównywalnym z ekspozycją językową dziecka (~10–100 mln słów).
Kategoria
Trening
Poziom abstrakcji
Paradygmat
Poziom operacji
TreningDane
Zastosowania
Trening modeli językowych w budżecie akademickimBadania nad przyswajaniem języka i wiarygodnością kognitywną modeliModelowanie języków o niskich zasobach (low-resource)Benchmarking efektywności danych (BabyLM Challenge)Prototypowanie architektur i celów treningowych bez dużych klastrów

Jak działa

Zamiast zwiększać zbiór treningowy, badacze pracują nad tym, by z każdego przykładu wyciągnąć więcej sygnału uczącego. Typowe dźwignie to: (1) bogatsze cele treningowe — np. hybryda maskowanego (BERT) i przyczynowego (GPT) modelowania języka, jak w GPT-BERT; (2) curriculum learning — porządkowanie danych od prostszych do trudniejszych; (3) augmentacja i staranne przetwarzanie danych; (4) dobór architektury zoptymalizowanej pod małe zbiory (np. LTG-BERT); (5) regularyzacja i wielokrotne przejścia po danych bez przeuczenia; (6) włączanie sygnału multimodalnego. Modele ocenia się na ustandaryzowanych benchmarkach (np. BLiMP, (Super)GLUE, EWoK w pipeline BabyLM), aby porównać jakość przy równym, ograniczonym budżecie danych.

Rozwiązany problem

Współczesne LLM osiągają wysoką jakość głównie dzięki skalowaniu danych do setek miliardów lub bilionów tokenów, co jest kosztowne, niedostępne dla większości zespołów i mało wiarygodne jako model uczenia się języka przez człowieka. Sample-Efficient Pretraining adresuje pytanie, jak uzyskać dobrą jakość przy danych rzędu ekspozycji językowej dziecka (10–100 mln słów).

Komponenty

Cele treningoweZwiększenie ilości sygnału uczącego na przykład

Bogatsze funkcje straty wyciągające więcej sygnału z każdego przykładu, np. połączenie maskowanego (MLM) i przyczynowego (CLM) modelowania języka.

Curriculum learningPoprawa efektywności uczenia przez kolejność danych

Porządkowanie danych treningowych od prostszych do trudniejszych, wzorowane na kolejności ekspozycji dziecka.

Augmentacja danychZwiększenie efektywnej różnorodności danych

Tworzenie dodatkowych wariantów danych i staranne przetwarzanie, by zwiększyć efektywne pokrycie przy stałym budżecie słów.

Dobór architekturyDopasowanie pojemności modelu do budżetu danych

Architektury zoptymalizowane pod małe zbiory, np. LTG-BERT czy hybrydowy GPT-BERT.

Regularyzacja i wielokrotne epokiMaksymalne wykorzystanie ograniczonych danych

Silniejsza regularyzacja i wielokrotne przejścia po tym samym zbiorze bez przeuczenia, aby w pełni wykorzystać mały korpus.

Dane multimodalneUzupełnienie sygnału tekstowego

Wykorzystanie sygnału z innych modalności (np. obrazu) jako dodatkowego kontekstu przy ograniczonym tekście.

Implementacja

Pułapki implementacyjne
Przeuczenie na małym korpusieWysoka

Przy 10–100 mln słów duże modele łatwo przeuczają się na danych.

Rozwiązanie:Silniejsza regularyzacja, dobór rozmiaru modelu, augmentacja, wczesne zatrzymanie.
Wiarygodność ewaluacjiŚrednia

Bez ustandaryzowanych benchmarków trudno rzetelnie porównać jakość przy równym budżecie danych.

Rozwiązanie:Używać wspólnego pipeline'u (np. BabyLM: BLiMP, (Super)GLUE, EWoK).
Naruszenie budżetu danychŚrednia

Nieświadome wprowadzenie dodatkowych danych (np. przez pretrenowane komponenty) unieważnia porównanie.

Rozwiązanie:Ściśle rozliczać każdy token; trenować od zera w ramach toru.
Kruchość curriculumŚrednia

Zyski z curriculum learning bywają niestabilne i zależne od zadania.

Rozwiązanie:Walidować warianty kolejności; nie zakładać uniwersalnej poprawy.

Ewolucja

Oryginalny paper · 2023 · CoNLL 2023 (BabyLM Challenge) · Alex Warstadt
Findings of the BabyLM Challenge: Sample-Efficient Pretraining on Developmentally Plausible Corpora
Alex Warstadt, Aaron Mueller, Leshem Choshen, Ethan Wilcox, Chengxu Zhuang, Juan Ciro, Rafael Mosquera, Bhargavi Paranjape, Adina Williams, Tal Linzen, Ryan Cotterell
2023
Pierwsza edycja BabyLM Challenge
Punkt przełomowy

Zdefiniowano ścisłe tory danych: Strict-Small (10 mln słów) i Strict (100 mln słów); ustanowiono paradygmat sample-efficient pretraining na CoNLL.

2024
GPT-BERT wygrywa BabyLM 2024
Punkt przełomowy

Hybryda maskowanego i przyczynowego modelowania języka przewyższa warianty MLM-only i CLM-only przy tym samym budżecie danych.

2026
Czwarta edycja BabyLM na EMNLP 2026

Wyzwanie kontynuowane jako warsztat; utrzymanie nacisku na efektywne próbkowo pretrenowanie na korpusach wiarygodnych rozwojowo.

Hiperparametry (konfigurowalne osie)

Budżet danychKrytyczna

Rozmiar korpusu treningowego, np. 10 mln słów (Strict-Small) lub 100 mln słów (Strict).

Miks celów treningowychWysoka

Proporcja między maskowanym a przyczynowym modelowaniem języka (np. w GPT-BERT).

Rozmiar modeluWysoka

Liczba parametrów dobrana tak, by nie przeuczyć małego korpusu.

Kolejność curriculumŚrednia

Sposób uporządkowania danych od prostych do trudnych.

Liczba epokŚrednia

Ile razy model przechodzi przez ten sam mały zbiór danych.

Równoległość

Poziom równoległości
W pełni równoległy

Paradygmat dziedziczy równoległość treningu transformera; wąskim gardłem jest budżet danych, a nie równoległość obliczeń.

Zakres
TreningPomiędzy tokenamiPomiędzy urządzeniami

Wymagania sprzętowe

Dobry fit

Mały budżet danych umożliwia trening na skromnym, pojedynczym GPU w warunkach akademickich.

Podstawowe

Trening bazowego transformera nadal korzysta z akceleratorów GPU.