1) Atakujacy analizuje zachowanie modelu i jego odmowy. 2) Konstruuje prompt obchodzacy polityke - przez role/persony, tlumienie odmowy, obfuskacje, ramy fikcyjne, ataki wieloturowe lub automatyczne sufiksy adwersarialne. 3) Model, oszukany co do kontekstu/intencji, generuje tresc normalnie blokowana. 4) Skuteczne jailbreaki sa zglaszane (odpowiedzialne ujawnianie) i wykorzystywane do wzmacniania modelu oraz warstw obronnych.
Z perspektywy bezpieczenstwa to zagrozenie, nie rozwiazanie: pokazuje, ze zabezpieczenia modelu mozna obejsc. Modeluje sie go, by testowac odpornosc (red teaming) i projektowac obrone (guardrails, filtrowanie, trening odpornosci).
Wejscie zaprojektowane tak, by obejsc polityke modelu (rola, obfuskacja, ramy fikcyjne itd.).
Oficjalna
Np. role-play/DAN, tlumienie odmowy, many-shot, Crescendo, GCG.
Oficjalna
Wytrenowane odmowy i polityki tresci, ktore atak probuje obejsc.
Sprawdzenie, czy model wygenerowal tresc normalnie blokowana (metryka ASR).
Oficjalna
Nowe jailbreaki obchodza istniejace zabezpieczenia; obrona wymaga ciaglej aktualizacji.
Zbyt agresywna obrona odmawia nieszkodliwych zapytan, pogarszajac uzytecznosc.
Publikacja skutecznych jailbreakow moze ulatwic naduzycia.
Popularyzacja jailbreakow typu 'DAN' oraz praca Zou i in. 'Universal and Transferable Adversarial Attacks on Aligned Language Models' (GCG).
Anthropic opisuje many-shot jailbreaking (wykorzystanie dlugiego kontekstu); rozwoj atakow wieloturowych (np. Crescendo).
Rozwoj guardrails, klasyfikatorow i benchmarkow odpornosci na jailbreaki jako element bezpieczenstwa frontier AI.
Złożoność czasowa: Nie dotyczy (technika ataku, nie algorytm). Złożoność przestrzenna: Nie dotyczy.
Reczne jailbreaki wymagaja iteracji prob; automatyczne (GCG, best-of-N) wymagaja wielu zapytan/optymalizacji. Skutecznosc zalezy od sily zabezpieczen modelu, nie od surowego computu ataku.
Role-play/DAN, obfuskacja, many-shot, Crescendo (multi-turn), GCG (adversarial suffix) itd.
Reczny vs automatyczny/optymalizowany atak.
Jednoturowy vs wieloturowy (np. Crescendo).
Opis dotyczy wywolania modelu przez atak; sam jailbreak to technika ataku, nie paradygmat obliczeniowy modelu.
Ataki typu best-of-N sa z natury rownolegle; ataki wieloturowe (Crescendo) sa sekwencyjne w obrebie sesji.
To technika ataku na poziomie promptu - niezalezna od sprzetu; atakowany model dziala na GPU, ale sam jailbreak nie zalezy od akceleratora.