Robocikowo>ROBOCIKOWO
Ocena jakości

Perplexity

1977AktywnyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
Standardowa metryka wewnętrzna modeli językowych: PPL = exp(średnia ujemna log-wiarygodność); niższa = lepszy model.
Kluczowa innowacja
Miara jakości modelu językowego: wykładnik uśrednionej ujemnej log-wiarygodności — intuicyjnie „efektywna liczba równie prawdopodobnych opcji" na każdym kroku predykcji.
Kategoria
Ocena jakości
Poziom abstrakcji
Primitive
Poziom operacji
Ewaluacja (runtime)Trening
Zastosowania
Ocena modeli językowych podczas pretreninguPorównywanie architektur na tym samym korpusieMonitorowanie zbieżności treninguOcena kompresji/dopasowania rozkładu

Jak działa

Dla korpusu testowego liczy się log-prawdopodobieństwo każdego tokenu pod modelem, uśrednia ujemne log-prawdopodobieństwa (entropia krzyżowa) i bierze wykładnik. Ponieważ zależy od tokenizacji i słownika, uczciwe porównania wymagają identycznych danych i sposobu tokenizacji; niższa perpleksja oznacza lepsze dopasowanie.

Rozwiązany problem

Trzeba mierzyć, jak dobrze model przewiduje tekst, niezależnie od konkretnego zadania. Perpleksja daje pojedynczą, porównywalną liczbę odzwierciedlającą jakość modelowania języka.

Komponenty

Entropia krzyżowaPodstawa metryki

Średnia ujemna log-wiarygodność danych pod modelem.

EksponencjacjaInterpretacja

Przekształcenie entropii krzyżowej w „liczbę efektywnych wyborów".

Ewolucja

1977
Perpleksja wprowadzona w rozpoznawaniu mowy (IBM, Jelinek i in.)
Punkt przełomowy
2018
Standardowa metryka pretreningu nowoczesnych LLM