Efektywność danych osiąga się przez wykorzystanie wiedzy spoza docelowego zbioru etykietowanego oraz przez inteligentny dobór danych. Główne mechanizmy: (1) uczenie transferowe i pretrening — model uczy się reprezentacji na dużym, tanim lub nieetykietowanym korpusie, a następnie jest dostrajany na małym zbiorze docelowym; (2) uczenie samonadzorowane — tworzy sygnał nadzoru z samych danych (np. zadania kontrastowe, maskowanie), redukując zapotrzebowanie na etykiety; (3) few-/one-/zero-shot i meta-uczenie — generalizacja z kilku (lub zera) przykładów na klasę; (4) aktywne uczenie — algorytm sam wybiera najbardziej informatywne przykłady do etykietowania (np. uncertainty sampling, query-by-committee, expected model change), dzięki czemu potrzeba mniej etykiet niż w zwykłym uczeniu nadzorowanym; (5) augmentacja danych — sztuczne rozszerzanie zbioru przez transformacje zachowujące etykietę; (6) destylacja wiedzy — przenoszenie wiedzy z większego modelu-nauczyciela. Postęp mierzy się krzywymi uczenia (jakość w funkcji liczby przykładów lub etykiet) oraz złożonością próbkową potrzebną do osiągnięcia zadanej dokładności.
Klasyczne uczenie nadzorowane wymaga dużych, ręcznie etykietowanych zbiorów, które w wielu domenach są kosztowne, rzadkie lub całkowicie niedostępne, a duże modele językowe widzą podczas treningu o rzędy wielkości więcej danych niż człowiek potrzebuje do opanowania języka. Efektywność danych adresuje ten koszt i tę nieproporcjonalność, redukując liczbę przykładów i etykiet potrzebnych do osiągnięcia użytecznej jakości.
Miara jakości osiąganej na jednostkę przykładów treningowych; ile próbek potrzeba do osiągnięcia zadanej dokładności.
Jakość osiągana na jednostkę etykiet; kluczowa gdy dane są dostępne, ale ich etykietowanie jest kosztowne.
Wykorzystanie reprezentacji wyuczonych na dużym korpusie źródłowym do zadania docelowego z małą liczbą danych.
Oficjalna
Tworzenie sygnału nadzoru z samych danych (maskowanie, zadania kontrastowe), co ogranicza zapotrzebowanie na etykiety.
Oficjalna
Generalizacja z kilku (few-shot), jednego (one-shot) lub zera (zero-shot) przykładów na klasę.
Oficjalna
Algorytm sam wybiera najbardziej informatywne przykłady do etykietowania (uncertainty sampling, query-by-committee), redukując liczbę potrzebnych etykiet.
Oficjalna
Sztuczne rozszerzanie zbioru treningowego przez transformacje zachowujące etykietę.
Oficjalna
Augmentacje lub duplikaty przenikające między zbiorem treningowym a testowym zawyżają wyniki i maskują rzeczywistą efektywność danych.
Iteracyjny dobór przykładów przez model może prowadzić do niereprezentatywnego zbioru i przeszacowania jakości.
Przy małej liczbie przykładów wyniki silnie zależą od losowego doboru, co utrudnia porównania.
Pretrening na korpusie zbyt odległym od zadania docelowego może pogorszyć jakość zamiast ją poprawić.
Systematyczny przegląd strategii aktywnego uczenia ugruntował ideę redukcji liczby potrzebnych etykiet przez inteligentny dobór przykładów.
Sformalizowanie uczenia transferowego jako sposobu wykorzystania wiedzy z zadania źródłowego dla zadania docelowego o małej liczbie danych.
Kontrastowe uczenie samonadzorowane pokazało, że reprezentacje z danych nieetykietowanych umożliwiają wysoką jakość przy niewielkiej liczbie etykiet.
Pokazano, że duży model językowy potrafi wykonać zadania z kilku przykładów podanych w prompt, bez aktualizacji wag — silny przejaw efektywności danych na etapie inferencji.
Wytrenowanie transformera wizyjnego wyłącznie na ImageNet (bez setek milionów zewnętrznych obrazów) dzięki destylacji przez uwagę spopularyzowało termin 'data-efficient' w widzeniu komputerowym.
Shared task na pretrening modeli językowych przy budżecie ok. 100 mln słów (i ścieżce 10 mln), inspirowany poznawczo prawdopodobną ekspozycją dziecka na język, uczynił efektywność danych centralnym celem badawczym w NLP.
Maksymalna liczba przykładów, które można poddać etykietowaniu.
Liczba przykładów na klasę w ustawieniu few-shot (k-shot).
Proporcja danych nieetykietowanych do etykietowanych w uczeniu półnadzorowanym/samonadzorowanym.
Rozmiar korpusu źródłowego użytego do pretreningu przed transferem.
Intensywność i różnorodność transformacji augmentacyjnych.
Liczba przykładów wybieranych do etykietowania w jednej iteracji aktywnego uczenia.
Efektywność danych jest właściwością algorytmiczną/statystyczną dotyczącą wykorzystania danych, niezależną od konkretnego typu akceleratora sprzętowego.