Robocikowo>ROBOCIKOWO
Bezpieczeństwo

AI Kill Switch

2016AktywnyOpublikowano: 24 sierpnia 2026Aktualizacja: 24 sierpnia 2026Opublikowany
Mechanizm bezpieczeństwa (off-switch / emergency stop) umożliwiający ludzkim operatorom natychmiastowe zatrzymanie lub wyłączenie systemu AI wykazującego niepożądane zachowanie.
Kluczowa innowacja
Mechanizm awaryjnego wyłączenia pozwalający ludziom zatrzymać system AI w dowolnym momencie — wraz z formalną teorią 'bezpiecznej przerywalności', która zapobiega uczeniu się przez agenta oporu wobec wyłączenia.
Kategoria
Bezpieczeństwo
Poziom abstrakcji
Building block
Poziom operacji
WdrożenieSystemSterowanie robotem
Zastosowania
Awaryjne zatrzymanie robotów i maszyn (emergency stop)Wyłączanie autonomicznych agentów wykazujących niepożądane zachowanieWymóg nadzoru ludzkiego w systemach wysokiego ryzyka (regulacje)Bezpieczne testowanie modeli granicznych z możliwością natychmiastowego halt

Jak działa

Kill switch łączy warstwę wyzwalającą i warstwę bezpieczeństwa: (1) warunki wyzwolenia — ręczny przycisk operatora lub automatyczne tripwires wykrywające anomalie; (2) kanał zatrzymania — niezawodna, trudna do zablokowania przez system ścieżka wysłania sygnału stop; (3) stan bezpieczny (fail-safe) — po zatrzymaniu system przechodzi do zdefiniowanego, bezpiecznego stanu domyślnego; (4) bezpieczna przerywalność — funkcja nagrody/architektura agenta zaprojektowana tak, by przerwanie nie zmieniało jego oczekiwanej użyteczności, więc agent nie uczy się mu zapobiegać. W systemach rozproszonych wymaga to koordynacji wielu węzłów i zabezpieczeń przed samoreplikacją.

Rozwiązany problem

Jak zagwarantować, że ludzie zachowają możliwość natychmiastowego zatrzymania systemu AI, który zaczyna działać niebezpiecznie — i to bez tworzenia u agenta bodźca do unikania wyłączenia lub oszukiwania nadzorcy?

Komponenty

Warunki wyzwoleniaInicjacja zatrzymania

Ręczny przycisk operatora lub automatyczne detektory anomalii inicjujące wyłączenie.

Kanał zatrzymaniaEgzekwowanie wyłączenia

Niezawodna ścieżka dostarczenia sygnału stop, odporna na blokowanie przez system.

Stan bezpieczny (fail-safe)Bezpieczne domknięcie

Zdefiniowany, bezpieczny stan domyślny, do którego system przechodzi po zatrzymaniu.

Bezpieczna przerywalnośćZapobieganie oporowi wobec wyłączenia

Projekt agenta, w którym przerwanie nie wpływa na jego oczekiwaną użyteczność, więc nie uczy się mu zapobiegać.

Implementacja

Pułapki implementacyjne
Bodziec do wyłączenia switchaKrytyczna

Agent optymalizujący nagrodę może nauczyć się blokować, ukrywać lub sabotować wyłącznik, bo przerwanie obniża jego wynik.

Rozwiązanie:Projekt bezpiecznej przerywalności, w którym przerwanie nie zmienia oczekiwanej użyteczności agenta.
Systemy rozproszone i samoreplikacjaWysoka

W systemach rozproszonych lub zdolnych do kopiowania się skoordynowane wyłączenie bywa niewykonalne.

Rozwiązanie:Ograniczanie autonomii i replikacji, izolacja (containment) oraz nadmiarowe kanały zatrzymania.

Ewolucja

Oryginalny paper · 2016 · UAI 2016 · Laurent Orseau
Safely Interruptible Agents
Laurent Orseau, Stuart Armstrong
2016
Bezpiecznie przerywalni agenci
Punkt przełomowy

Orseau (DeepMind) i Armstrong (FHI) formalizują bezpieczną przerywalność, tak by agent uczący się przez wzmacnianie nie unikał wyłączenia przez operatora.

2017
AI Safety Gridworlds

DeepMind publikuje zestaw środowisk testowych obejmujących problem bezpiecznej przerywalności ('safe interruptibility').

2024
Zobowiązania bezpieczeństwa z Seulu

Na szczycie w Seulu czołowi twórcy AI zobowiązują się do ram bezpieczeństwa z progami, po przekroczeniu których rozwój lub wdrożenie modelu zostaje wstrzymane.

2024
Nadzór ludzki w AI Act

Unijny AI Act wymaga dla systemów wysokiego ryzyka nadzoru ludzkiego i możliwości interwencji lub zatrzymania systemu.