Robocikowo>ROBOCIKOWO
Zachowanie AI

Representation Engineering (RepE)

2023AktywnyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
Paradygmat (Zou i in., 2023) traktujący reprezentacje jako podstawową jednostkę analizy — odczyt (reading) i kontrola (control) pojęć jak prawdomówność czy szkodliwość.
Kluczowa innowacja
Odgórne (top-down) podejście do przejrzystości i kontroli AI: analizuje i steruje wysokopoziomowymi pojęciami zapisanymi w reprezentacjach sieci zamiast pojedynczych neuronów.
Kategoria
Zachowanie AI
Poziom abstrakcji
Paradygmat
Poziom operacji
InferencjaPo-treningModel
Zastosowania
Sterowanie zachowaniem LLM (prawdomówność, bezpieczeństwo)Wykrywanie kłamstwa/halucynacji przez odczyt reprezentacjiKontrola pojęć bez douczania wagBadania nad przejrzystością (AI transparency)

Jak działa

RepE zbiera aktywacje modelu dla bodźców kontrastujących dane pojęcie (np. prawda vs fałsz), wyznacza "kierunek pojęcia" w przestrzeni reprezentacji (Representation Reading) i wykorzystuje go do sterowania: dodanie/odjęcie kierunku do aktywacji w czasie inferencji wzmacnia lub tłumi cechę (Representation Control), a odczyty służą też do detekcji (np. wykrywanie kłamstwa modelu).

Rozwiązany problem

Zrozumienie i kontrola zachowań LLM od strony pojedynczych neuronów są trudne i nie skalują się. RepE pracuje na poziomie reprezentacji, gdzie wysokopoziomowe pojęcia są czytelniejsze i sterowalne.

Komponenty

Representation ReadingAnaliza

Lokalizowanie kierunkow/pojęć w reprezentacjach z bodźców kontrastujących.

Representation ControlKontrola

Sterowanie zachowaniem przez modyfikację aktywacji wzdłuż kierunku pojęcia.