Robocikowo>ROBOCIKOWO
Trening

KL Divergence

1951AktywnyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
Dywergencja Kullbacka-Leiblera (KL) to nieujemna, niesymetryczna miara różnicy między dwoma rozkładami prawdopodobieństwa; fundament funkcji straty, destylacji wiedzy, wariacyjnego wnioskowania i regularyzacji w RLHF.
Kluczowa innowacja
Miara z teorii informacji kwantyfikująca, o ile jeden rozkład prawdopodobieństwa różni się od drugiego (referencyjnego) — interpretowana jako średnia liczba dodatkowych bitów potrzebnych do zakodowania danych z rozkładu P przy użyciu kodu zoptymalizowanego dla Q.
Kategoria
Trening
Poziom abstrakcji
Primitive
Poziom operacji
TreningPo-treningEwaluacja (runtime)
Zastosowania
Funkcja straty i regularyzacja w treningu modeliDestylacja wiedzy (KL między nauczycielem a uczniem)Kara KL względem polityki referencyjnej w RLHF/PPODolna granica ELBO we wnioskowaniu wariacyjnym (VAE)Pomiar rozbieżności rozkładów wyjścia przy kwantyzacji i kompresji modeli

Jak działa

Dla rozkładów dyskretnych P i Q dywergencję KL definiuje się jako D_KL(P || Q) = suma_x P(x) log( P(x) / Q(x) ), a dla ciągłych jako całkę analogicznego wyrażenia. Jest nieujemna (D_KL >= 0) i równa zero wtedy i tylko wtedy, gdy P = Q (nierówność Gibbsa). Nie jest symetryczna, D_KL(P || Q) != D_KL(Q || P), i nie spełnia nierówności trójkąta, więc nie jest metryką. Wiąże się z entropią krzyżową: H(P, Q) = H(P) + D_KL(P || Q), dlatego minimalizacja entropii krzyżowej względem parametrów Q jest równoważna minimalizacji KL. W praktyce w AI liczy się ją na wyjściach softmax: w destylacji minimalizuje się KL między zmiękczonym rozkładem nauczyciela a uczniem; w RLHF (PPO) dodaje się karę KL względem polityki referencyjnej, by ograniczyć dryf modelu; w wnioskowaniu wariacyjnym minimalizuje się KL między rozkładem aproksymującym a a posteriori.

Rozwiązany problem

Uczenie i ocena modeli probabilistycznych wymagają sposobu, by zmierzyć, jak bardzo przewidywany rozkład odbiega od rozkładu docelowego lub referencyjnego. Dywergencja KL dostarcza takiej miary o ugruntowaniu w teorii informacji: pozwala definiować funkcje straty (minimalizacja KL względem danych równoważna maksymalizacji wiarygodności), przenosić wiedzę z modelu nauczyciela do ucznia (destylacja), aproksymować rozkłady w wnioskowaniu wariacyjnym i utrzymywać model dostrajany blisko polityki referencyjnej w RLHF.

Kluczowe mechanizmy

Wartość oczekiwana log(P/Q) względem P
Związek z entropią krzyżową: H(P,Q) = H(P) + D_KL(P||Q)
Minimalizacja KL jako cel treningu / destylacji
Kara KL względem polityki referencyjnej (RLHF/PPO)
Człon KL w dolnej granicy dowodowej ELBO (VAE)

Mocne strony i ograniczenia

Mocne strony
✓Ugruntowanie w teorii informacji (interpretacja bitowa)
✓Związek z entropią krzyżową i estymacja największej wiarygodności
✓Uniwersalna: funkcje straty, destylacja, RLHF, VAE, pomiar kwantyzacji
✓Różniczkowalna, łatwa do optymalizacji gradientowej
✓Tania obliczeniowo (operacja punktowa na rozkładach)
Ograniczenia
✗Niesymetryczna: D_KL(P||Q) != D_KL(Q||P) — wymaga wyboru kierunku
✗Nie jest metryką (brak nierówności trójkąta)
✗Rozbiega do nieskończoności, gdy Q(x)=0, a P(x)>0
✗Wrażliwa numerycznie bez log-softmax / wygładzania
✗Forward vs reverse KL dają różne zachowania (mode-covering vs mode-seeking)

Komponenty

Rozkład bazowy PWagi w sumie/całce KL

Rozkład odniesienia (np. dane, rozkład nauczyciela, rozkład docelowy), względem którego mierzy się rozbieżność.

Rozkład aproksymujący QCel optymalizacji minimalizującej KL

Rozkład modelu (np. przewidywania ucznia, polityka dostrajana, rozkład wariacyjny), którego odległość od P się ocenia.

Logarytmiczny stosunek prawdopodobieństwRdzeń obliczeniowy miary

Wyrażenie log(P(x)/Q(x)) ważone przez P(x); jego wartość oczekiwana względem P daje dywergencję KL.

Implementacja

Pułapki implementacyjne
Niesymetryczność i wybór kierunkuŚrednia

D_KL(P||Q) różni się od D_KL(Q||P): forward KL wymusza pokrywanie modów, reverse KL wybór jednego modu; zły kierunek daje niepożądane zachowanie.

Rozwiązanie:Świadomie wybierz kierunek zgodnie z celem; rozważ symetryczne alternatywy (dywergencja Jensena-Shannona) gdy potrzeba symetrii.
Rozbieżność do nieskończoności przy zerowym QWysoka

Gdy Q(x)=0, a P(x)>0, wyraz log(P/Q) daje nieskończoność, powodując niestabilność numeryczną.

Rozwiązanie:Stosuj wygładzanie (smoothing), log-softmax i stabilne implementacje; operuj na logarytmach prawdopodobieństw.

Ewolucja

Oryginalny paper · 1951 · Annals of Mathematical Statistics · Solomon Kullback
On Information and Sufficiency
Solomon Kullback, Richard Leibler
1951
Kullback i Leibler definiują dywergencję
Punkt przełomowy

W pracy On Information and Sufficiency wprowadzono miarę rozbieżności rozkładów, później nazwaną dywergencją KL.

2013
KL jako czlon ELBO w VAE

Autoenkodery wariacyjne (Kingma, Welling) wykorzystują człon KL do regularyzacji przestrzeni latentnej względem rozkładu a priori.

2017
Destylacja i kara KL w RLHF/PPO

Destylacja wiedzy (Hinton, 2015) i późniejszy RLHF stosują KL jako cel przenoszenia wiedzy oraz karę utrzymującą politykę blisko referencyjnej.

Hiperparametry (konfigurowalne osie)

Kierunek dywergencjiWysoka

Forward KL D(P||Q) wymusza pokrywanie modów, reverse KL D(Q||P) wybór jednego modu.

forward (P||Q)Mode-covering, np. entropia krzyżowa.
reverse (Q||P)Mode-seeking, np. wnioskowanie wariacyjne.
Temperatura (destylacja)Średnia

Współczynnik zmiękczający rozkłady softmax przed liczeniem KL w destylacji wiedzy.

T=1Bez zmiękczenia.
T=2-4Typowe w destylacji.
Współczynnik kary KL (RLHF)Wysoka

Waga kary KL względem polityki referencyjnej w RLHF/PPO.

beta ~ 0.01-0.1Balans nagroda vs dryf.

Złożoność obliczeniowa

Charakterystyki obliczeniowe
→Operacja punktowa: log, mnożenie, redukcja (suma)
→Koszt liniowy w liczbie kategorii (np. rozmiar słownika)
→Różniczkowalna względem parametrów Q
→Stabilizowana przez log-softmax i wygładzanie
→Realizowana wydajnie na CPU i GPU

Złożoność czasowa: O(K) dla K kategorii rozkładu dyskretnego. Złożoność przestrzenna: O(K) na rozkład o K kategoriach.

Uwagi do benchmarku

Destylacja wiedzy z użyciem KL na zmiękczonych rozkładach (Hinton 2015) pozwala mniejszym modelom zbliżyć się jakością do większych nauczycieli. W RLHF/PPO współczynnik kary KL (np. beta) kontroluje kompromis między dopasowaniem do nagrody a bliskością do polityki referencyjnej — zbyt niski powoduje reward hacking i dryf, zbyt wysoki hamuje uczenie.

Wąskie gardło obliczeniowe

Rozmiar przestrzeni zdarzeń (słownik)

Koszt KL rośnie z liczbą kategorii rozkładu (np. rozmiaru słownika w modelu językowym); poza tym jest to tania operacja punktowa.

Zależy od
Liczba kategorii KStabilność numeryczna

Paradygmat wykonania

Tryb główny
Gęsty

Wszystkie składniki rozkładu wchodzą do sumy; brak selektywnej aktywacji.

Wzorzec aktywacji
Wszystkie ścieżki aktywne
Mechanizm routingu

KL to operacja matematyczna na rozkładach, bez routingu czy warunkowego wykonania.

Równoległość

Poziom równoległości
W pełni równoległy

Operacja punktowa i redukcja są w pełni równoległe na wektorach/tensorach prawdopodobieństw.

Zakres
TreningInferencja

Wymagania sprzętowe

Podstawowe

KL to operacja punktowa na rozkładach (log, mnożenie, redukcja), realizowana wydajnie na dowolnym akceleratorze wspierającym operacje tensorowe.