Szacowanie, na ile pewna jest odpowiedź modelu (kalibracja i niepewność) — np. przez prawdopodobieństwa tokenów, werbalizowaną pewność czy zgodność wielu próbek.
Kluczowa
innowacja
Ilościowe określenie zaufania do odpowiedzi modelu, nie tylko samej odpowiedzi.
Kategoria
Ocena jakości
Poziom abstrakcji
Wzorzec
Poziom operacji
InferencjaEwaluacja (runtime)
Zastosowania
Wykrywanie halucynacjiSelektywna predykcja / abstynencjaRouting do weryfikacji lub człowieka
Jak działa
Szacuje się pewność z prawdopodobieństw tokenów, entropii, zgodności wielu próbek lub werbalizowanej pewności modelu.
Rozwiązany problem
Modele często odpowiadają pewnie także wtedy, gdy się mylą (słaba kalibracja, halucynacje).