2016AktywnyAktualizacja: 22 września 2026Opublikowany
Metoda interpretowalności: trenowanie prostego klasyfikatora (probe) na wewnętrznych aktywacjach modelu, by sprawdzić, jaka informacja jest w nich zakodowana.
Kluczowa
innowacja
Odczyt zakodowanej informacji z aktywacji za pomocą prostego, wyuczonego klasyfikatora.
Kategoria
Ocena jakości
Poziom abstrakcji
Wzorzec
Poziom operacji
InferencjaEwaluacja (runtime)
Zastosowania
Analiza reprezentacji LLMWykrywanie wiedzy/uprzedzeńBadania interpretowalności
Jak działa
Zamraża się model, pobiera aktywacje dla wejść i trenuje prosty klasyfikator przewidujący badaną cechę z tych aktywacji.
Rozwiązany problem
Trzeba ustalić, jaka informacja jest zakodowana w ukrytych reprezentacjach modelu.