2025BadawczyAktualizacja: 22 września 2026Opublikowany
Kierunek w przestrzeni aktywacji modelu skorelowany z poprawnością jego odpowiedzi — pozwala wykrywać i potencjalnie sterować „wiedzą o trafności” zakodowaną w reprezentacjach.
Kluczowa
innowacja
Wskazanie liniowego kierunku „poprawności” zakodowanego w aktywacjach modelu.