Zamiast zwiększać zbiór treningowy, badacze pracują nad tym, by z każdego przykładu wyciągnąć więcej sygnału uczącego. Typowe dźwignie to: (1) bogatsze cele treningowe — np. hybryda maskowanego (BERT) i przyczynowego (GPT) modelowania języka, jak w GPT-BERT; (2) curriculum learning — porządkowanie danych od prostszych do trudniejszych; (3) augmentacja i staranne przetwarzanie danych; (4) dobór architektury zoptymalizowanej pod małe zbiory (np. LTG-BERT); (5) regularyzacja i wielokrotne przejścia po danych bez przeuczenia; (6) włączanie sygnału multimodalnego. Modele ocenia się na ustandaryzowanych benchmarkach (np. BLiMP, (Super)GLUE, EWoK w pipeline BabyLM), aby porównać jakość przy równym, ograniczonym budżecie danych.
Współczesne LLM osiągają wysoką jakość głównie dzięki skalowaniu danych do setek miliardów lub bilionów tokenów, co jest kosztowne, niedostępne dla większości zespołów i mało wiarygodne jako model uczenia się języka przez człowieka. Sample-Efficient Pretraining adresuje pytanie, jak uzyskać dobrą jakość przy danych rzędu ekspozycji językowej dziecka (10–100 mln słów).
Bogatsze funkcje straty wyciągające więcej sygnału z każdego przykładu, np. połączenie maskowanego (MLM) i przyczynowego (CLM) modelowania języka.
Porządkowanie danych treningowych od prostszych do trudniejszych, wzorowane na kolejności ekspozycji dziecka.
Tworzenie dodatkowych wariantów danych i staranne przetwarzanie, by zwiększyć efektywne pokrycie przy stałym budżecie słów.
Architektury zoptymalizowane pod małe zbiory, np. LTG-BERT czy hybrydowy GPT-BERT.
Silniejsza regularyzacja i wielokrotne przejścia po tym samym zbiorze bez przeuczenia, aby w pełni wykorzystać mały korpus.
Wykorzystanie sygnału z innych modalności (np. obrazu) jako dodatkowego kontekstu przy ograniczonym tekście.
Przy 10–100 mln słów duże modele łatwo przeuczają się na danych.
Bez ustandaryzowanych benchmarków trudno rzetelnie porównać jakość przy równym budżecie danych.
Nieświadome wprowadzenie dodatkowych danych (np. przez pretrenowane komponenty) unieważnia porównanie.
Zyski z curriculum learning bywają niestabilne i zależne od zadania.
Zdefiniowano ścisłe tory danych: Strict-Small (10 mln słów) i Strict (100 mln słów); ustanowiono paradygmat sample-efficient pretraining na CoNLL.
Hybryda maskowanego i przyczynowego modelowania języka przewyższa warianty MLM-only i CLM-only przy tym samym budżecie danych.
Wyzwanie kontynuowane jako warsztat; utrzymanie nacisku na efektywne próbkowo pretrenowanie na korpusach wiarygodnych rozwojowo.
Rozmiar korpusu treningowego, np. 10 mln słów (Strict-Small) lub 100 mln słów (Strict).
Proporcja między maskowanym a przyczynowym modelowaniem języka (np. w GPT-BERT).
Liczba parametrów dobrana tak, by nie przeuczyć małego korpusu.
Sposób uporządkowania danych od prostych do trudnych.
Ile razy model przechodzi przez ten sam mały zbiór danych.
Paradygmat dziedziczy równoległość treningu transformera; wąskim gardłem jest budżet danych, a nie równoległość obliczeń.
Mały budżet danych umożliwia trening na skromnym, pojedynczym GPU w warunkach akademickich.
Trening bazowego transformera nadal korzysta z akceleratorów GPU.