Ocena jakości
Perplexity
1977AktywnyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
Standardowa metryka wewnętrzna modeli językowych: PPL = exp(średnia ujemna log-wiarygodność); niższa = lepszy model.
Kluczowa
innowacja
Miara jakości modelu językowego: wykładnik uśrednionej ujemnej log-wiarygodności — intuicyjnie „efektywna liczba równie prawdopodobnych opcji" na każdym kroku predykcji.
Kategoria
Ocena jakości
Poziom abstrakcji
Primitive
Poziom operacji
Ewaluacja (runtime)Trening
Zastosowania
Ocena modeli językowych podczas pretreninguPorównywanie architektur na tym samym korpusieMonitorowanie zbieżności treninguOcena kompresji/dopasowania rozkładu
Jak działa
Dla korpusu testowego liczy się log-prawdopodobieństwo każdego tokenu pod modelem, uśrednia ujemne log-prawdopodobieństwa (entropia krzyżowa) i bierze wykładnik. Ponieważ zależy od tokenizacji i słownika, uczciwe porównania wymagają identycznych danych i sposobu tokenizacji; niższa perpleksja oznacza lepsze dopasowanie.
Rozwiązany problem
Trzeba mierzyć, jak dobrze model przewiduje tekst, niezależnie od konkretnego zadania. Perpleksja daje pojedynczą, porównywalną liczbę odzwierciedlającą jakość modelowania języka.
Komponenty
Entropia krzyżowaPodstawa metryki
Średnia ujemna log-wiarygodność danych pod modelem.
EksponencjacjaInterpretacja
Przekształcenie entropii krzyżowej w „liczbę efektywnych wyborów".
Ewolucja
1977
Perpleksja wprowadzona w rozpoznawaniu mowy (IBM, Jelinek i in.)
Punkt przełomowy2018
Standardowa metryka pretreningu nowoczesnych LLM