2020AktywnyAktualizacja: 22 września 2026Opublikowany
Nurt interpretowalności dążący do odtworzenia wewnętrznych „obwodów” i algorytmów modelu — reverse-engineeringu sieci neuronowej na poziomie mechanizmów.
Kluczowa
innowacja
Reverse-engineering sieci neuronowej na poziomie obwodów i algorytmów, nie tylko korelacji.
Kategoria
Bezpieczeństwo
Poziom abstrakcji
Paradygmat
Poziom operacji
ModelInferencja
Zastosowania
Bezpieczeństwo i audyt AIAnaliza obwodów i cech (SAE)Wykrywanie niepożądanych zachowań
Jak działa
Bada się neurony, głowice uwagi i cechy oraz obwody je łączące; interwencje przyczynowe potwierdzają rolę komponentów.
Rozwiązany problem
Duże modele są „czarnymi skrzynkami”, przez co trudno ufać ich zachowaniu i je audytować.