Zachowanie AI
Representation Engineering (RepE)
2023AktywnyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
Paradygmat (Zou i in., 2023) traktujący reprezentacje jako podstawową jednostkę analizy — odczyt (reading) i kontrola (control) pojęć jak prawdomówność czy szkodliwość.
Kluczowa
innowacja
Odgórne (top-down) podejście do przejrzystości i kontroli AI: analizuje i steruje wysokopoziomowymi pojęciami zapisanymi w reprezentacjach sieci zamiast pojedynczych neuronów.
Kategoria
Zachowanie AI
Poziom abstrakcji
Paradygmat
Poziom operacji
InferencjaPo-treningModel
Zastosowania
Sterowanie zachowaniem LLM (prawdomówność, bezpieczeństwo)Wykrywanie kłamstwa/halucynacji przez odczyt reprezentacjiKontrola pojęć bez douczania wagBadania nad przejrzystością (AI transparency)
Jak działa
RepE zbiera aktywacje modelu dla bodźców kontrastujących dane pojęcie (np. prawda vs fałsz), wyznacza "kierunek pojęcia" w przestrzeni reprezentacji (Representation Reading) i wykorzystuje go do sterowania: dodanie/odjęcie kierunku do aktywacji w czasie inferencji wzmacnia lub tłumi cechę (Representation Control), a odczyty służą też do detekcji (np. wykrywanie kłamstwa modelu).
Rozwiązany problem
Zrozumienie i kontrola zachowań LLM od strony pojedynczych neuronów są trudne i nie skalują się. RepE pracuje na poziomie reprezentacji, gdzie wysokopoziomowe pojęcia są czytelniejsze i sterowalne.
Komponenty
Representation ReadingAnaliza
Lokalizowanie kierunkow/pojęć w reprezentacjach z bodźców kontrastujących.
Representation ControlKontrola
Sterowanie zachowaniem przez modyfikację aktywacji wzdłuż kierunku pojęcia.
Ewolucja
Oryginalny paper · 2023 · arXiv 2023 · Andy Zou
Representation Engineering: A Top-Down Approach to AI Transparency
Andy Zou, et al.
2023
Zou i in. wprowadzają Representation Engineering
Punkt przełomowy