Robocikowo>ROBOCIKOWO
Dane

Efektywność danych

AktywnyOpublikowany
Zdolność modelu ML do osiągania wysokiej jakości przy minimalnej ilości danych i etykiet; przekrojowy paradygmat obejmujący transfer, few-shot, aktywne uczenie, augmentację i uczenie samonadzorowane.
Kluczowa innowacja
Przesuwa cel uczenia z maksymalizacji jakości przy nieograniczonych danych na maksymalizację jakości uzyskiwanej na jednostkę danych lub etykiet.
Kategoria
Dane
Poziom abstrakcji
Paradygmat
Poziom operacji
TreningDanePo-trening
Zastosowania
Medycyna i obrazowanie medyczne (mało etykietowanych danych)Języki nisko-zasobowe (low-resource NLP)Robotyka i uczenie polityk z ograniczonej liczby demonstracjiKlasyfikacja few-shot i one-shotPoznawczo prawdopodobny pretrening języka (BabyLM Challenge)Wykrywanie anomalii i klasy rzadkiePersonalizacja przy małej liczbie danych użytkownika

Jak działa

Efektywność danych osiąga się przez wykorzystanie wiedzy spoza docelowego zbioru etykietowanego oraz przez inteligentny dobór danych. Główne mechanizmy: (1) uczenie transferowe i pretrening — model uczy się reprezentacji na dużym, tanim lub nieetykietowanym korpusie, a następnie jest dostrajany na małym zbiorze docelowym; (2) uczenie samonadzorowane — tworzy sygnał nadzoru z samych danych (np. zadania kontrastowe, maskowanie), redukując zapotrzebowanie na etykiety; (3) few-/one-/zero-shot i meta-uczenie — generalizacja z kilku (lub zera) przykładów na klasę; (4) aktywne uczenie — algorytm sam wybiera najbardziej informatywne przykłady do etykietowania (np. uncertainty sampling, query-by-committee, expected model change), dzięki czemu potrzeba mniej etykiet niż w zwykłym uczeniu nadzorowanym; (5) augmentacja danych — sztuczne rozszerzanie zbioru przez transformacje zachowujące etykietę; (6) destylacja wiedzy — przenoszenie wiedzy z większego modelu-nauczyciela. Postęp mierzy się krzywymi uczenia (jakość w funkcji liczby przykładów lub etykiet) oraz złożonością próbkową potrzebną do osiągnięcia zadanej dokładności.

Rozwiązany problem

Klasyczne uczenie nadzorowane wymaga dużych, ręcznie etykietowanych zbiorów, które w wielu domenach są kosztowne, rzadkie lub całkowicie niedostępne, a duże modele językowe widzą podczas treningu o rzędy wielkości więcej danych niż człowiek potrzebuje do opanowania języka. Efektywność danych adresuje ten koszt i tę nieproporcjonalność, redukując liczbę przykładów i etykiet potrzebnych do osiągnięcia użytecznej jakości.

Komponenty

Efektywność próbkowa (sample efficiency)Wymiar efektywności danych dotyczący liczby przykładów

Miara jakości osiąganej na jednostkę przykładów treningowych; ile próbek potrzeba do osiągnięcia zadanej dokładności.

Efektywność etykiet (label efficiency)Wymiar efektywności danych dotyczący liczby etykiet

Jakość osiągana na jednostkę etykiet; kluczowa gdy dane są dostępne, ale ich etykietowanie jest kosztowne.

Uczenie transferowe i pretreningGłówna technika osiągania efektywności danych

Wykorzystanie reprezentacji wyuczonych na dużym korpusie źródłowym do zadania docelowego z małą liczbą danych.

Oficjalna

Uczenie samonadzorowaneTechnika zwiększająca efektywność etykiet

Tworzenie sygnału nadzoru z samych danych (maskowanie, zadania kontrastowe), co ogranicza zapotrzebowanie na etykiety.

Oficjalna

Few-shot / meta-uczenieTechnika ekstremalnie niskiej liczby przykładów

Generalizacja z kilku (few-shot), jednego (one-shot) lub zera (zero-shot) przykładów na klasę.

Oficjalna

Aktywne uczenieTechnika inteligentnego doboru danych do etykietowania

Algorytm sam wybiera najbardziej informatywne przykłady do etykietowania (uncertainty sampling, query-by-committee), redukując liczbę potrzebnych etykiet.

Oficjalna

Augmentacja danychTechnika zwiększania efektywnej liczby przykładów

Sztuczne rozszerzanie zbioru treningowego przez transformacje zachowujące etykietę.

Oficjalna

Implementacja

Pułapki implementacyjne
Wyciek danych przy augmentacji i podziale zbioruWysoka

Augmentacje lub duplikaty przenikające między zbiorem treningowym a testowym zawyżają wyniki i maskują rzeczywistą efektywność danych.

Rozwiązanie:Dziel dane przed augmentacją i deduplikuj na poziomie źródłowych przykładów.
Obciążenie próby w aktywnym uczeniuŚrednia

Iteracyjny dobór przykładów przez model może prowadzić do niereprezentatywnego zbioru i przeszacowania jakości.

Rozwiązanie:Łącz strategie zapytań z losowym doborem i monitoruj pokrycie rozkładu.
Wysoka wariancja ewaluacji na małych zbiorachWysoka

Przy małej liczbie przykładów wyniki silnie zależą od losowego doboru, co utrudnia porównania.

Rozwiązanie:Raportuj średnią i odchylenie z wielu losowań (seeds) i epizodów few-shot.
Negatywny transfer (niedopasowanie dystrybucji)Średnia

Pretrening na korpusie zbyt odległym od zadania docelowego może pogorszyć jakość zamiast ją poprawić.

Rozwiązanie:Dobieraj korpus źródłowy zbliżony do domeny docelowej i waliduj transfer.

Ewolucja

2009
Przegląd aktywnego uczenia (Settles)

Systematyczny przegląd strategii aktywnego uczenia ugruntował ideę redukcji liczby potrzebnych etykiet przez inteligentny dobór przykładów.

2010
Przegląd uczenia transferowego (Pan i Yang)

Sformalizowanie uczenia transferowego jako sposobu wykorzystania wiedzy z zadania źródłowego dla zadania docelowego o małej liczbie danych.

2020
SimCLR — uczenie kontrastowe dla efektywności etykiet

Kontrastowe uczenie samonadzorowane pokazało, że reprezentacje z danych nieetykietowanych umożliwiają wysoką jakość przy niewielkiej liczbie etykiet.

2020
GPT-3 — few-shot in-context learning
Punkt przełomowy

Pokazano, że duży model językowy potrafi wykonać zadania z kilku przykładów podanych w prompt, bez aktualizacji wag — silny przejaw efektywności danych na etapie inferencji.

2021
DeiT — data-efficient image transformers

Wytrenowanie transformera wizyjnego wyłącznie na ImageNet (bez setek milionów zewnętrznych obrazów) dzięki destylacji przez uwagę spopularyzowało termin 'data-efficient' w widzeniu komputerowym.

2023
BabyLM Challenge — sample-efficient pretraining
Punkt przełomowy

Shared task na pretrening modeli językowych przy budżecie ok. 100 mln słów (i ścieżce 10 mln), inspirowany poznawczo prawdopodobną ekspozycją dziecka na język, uczynił efektywność danych centralnym celem badawczym w NLP.

Hiperparametry (konfigurowalne osie)

Budżet etykietKrytyczna

Maksymalna liczba przykładów, które można poddać etykietowaniu.

Liczba przykładów na klasę (k)Wysoka

Liczba przykładów na klasę w ustawieniu few-shot (k-shot).

Stosunek danych nieetykietowanych do etykietowanychWysoka

Proporcja danych nieetykietowanych do etykietowanych w uczeniu półnadzorowanym/samonadzorowanym.

Rozmiar korpusu pretreningowegoWysoka

Rozmiar korpusu źródłowego użytego do pretreningu przed transferem.

Siła augmentacjiŚrednia

Intensywność i różnorodność transformacji augmentacyjnych.

Rozmiar partii zapytań (aktywne uczenie)Średnia

Liczba przykładów wybieranych do etykietowania w jednej iteracji aktywnego uczenia.

Wymagania sprzętowe

Podstawowe

Efektywność danych jest właściwością algorytmiczną/statystyczną dotyczącą wykorzystania danych, niezależną od konkretnego typu akceleratora sprzętowego.