Zamiast osobnego nauczyciela, sygnał nadzoru pochodzi z samego modelu. (1) Wariant iteracyjny (Born-Again): trenuje się model, a następnie jego identyczną kopię, używając zmiękczonych predykcji poprzedniej generacji jako celów; proces można powtarzać. (2) Wariant „w sieci” (Be Your Own Teacher): sieć dzieli się na sekcje z dodatkowymi klasyfikatorami pomocniczymi; głębsze (dokładniejsze) sekcje pełnią rolę nauczyciela dla płytszych poprzez stratę dystylacji na logitach i/lub cechach. (3) Wariant oparty na predykcjach: model uczy się od własnych uśrednionych/zmiękczonych wyjść. We wszystkich wariantach funkcja kosztu łączy zwykłą stratę na twardych etykietach z dywergencją KL między predykcjami ucznia i nauczyciela, skalowaną temperaturą softmax.
Klasyczna destylacja wiedzy wymaga wytrenowania osobnego, dużego modelu-nauczyciela, co jest kosztowne i nie zawsze możliwe. Samodestylacja usuwa tę zależność: pozwala poprawić dokładność i regularyzację modelu bez dodatkowej sieci, a w wariancie „w sieci” umożliwia skalowalną wgłąb inferencję na urządzeniach brzegowych.
Źródło miękkich celów pochodzące z samego modelu: głębsze warstwy, poprzednia generacja wag lub uśrednione/zmiękczone predykcje.
Ten sam lub identycznie sparametryzowany model (albo jego płytsza sekcja) uczony tak, by dopasować się do miękkich celów nauczyciela-siebie.
Kombinacja straty na twardych etykietach (cross-entropy) oraz dywergencji KL między zmiękczonymi predykcjami ucznia i nauczyciela, skalowanej temperaturą.
Zbyt niska lub zbyt wysoka temperatura degraduje sygnał miękkich celów.
Zbyt duża waga straty KL może pogorszyć dokładność na twardych etykietach.
Kolejne generacje (Born-Again) zwielokrotniają czas treningu.
Wprowadzenie destylacji wiedzy z osobnym nauczycielem i miękkimi celami — mechanizm bazowy dla samodestylacji.
Uczeń identyczny z nauczycielem przewyższa go — wczesny, iteracyjny wariant samodestylacji.
Samodestylacja wewnątrz sieci: głębsze warstwy uczą płytsze; termin i metoda „self distillation”.
Teoretyczne wyjaśnienie: iteracje samodestylacji progresywnie ograniczają bazę funkcji, wzmacniając regularyzację.
Skaluje „miękkość” predykcji nauczyciela; kluczowa dla jakości sygnału dystylacji.
Balans między stratą na twardych etykietach a stratą dystylacji (KL).
Liczba iteracji samodestylacji w wariancie Born-Again.
Podział sieci na sekcje z klasyfikatorami pomocniczymi w wariancie „w sieci”.
Wariant „w sieci” (deep→shallow) trenuje się równolegle w jednym przebiegu; wariant iteracyjny (Born-Again) jest sekwencyjny między kolejnymi generacjami.
Technika treningowa niezależna od sprzętu; działa na dowolnym akceleratorze (najczęściej GPU).