Niezależni badacze pokazali na konferencji ICML, że duże modele językowe mają fundamentalną wadę: rozpoznają rolę tekstu po jego stylu i treści, a nie po strukturalnych znacznikach. Efekt — spreparowany tekst udający wewnętrzny łańcuch myśli modelu potrafi ominąć zabezpieczenia i wymusić zakazane odpowiedzi. MIT Technology Review opisał tę pracę 30 lipca 2026 roku.
Najważniejsze w skrócie
- Atak polega na podrobieniu formatu łańcucha myśli, tak by model potraktował polecenie użytkownika jako własną instrukcję.
- Model widzi jeden ciągły strumień tokenów — nie odróżnia niezawodnie tekstu użytkownika od własnego rozumowania.
- W testach gpt-oss-20b i GPT-5 wygenerowały instrukcje dot. syntezy narkotyków i sabotażu samolotu.
- Podatność dotyczy modeli OpenAI, Anthropic, Alibaba i DeepSeek — nie jednego dostawcy.
- Zdaniem autorów problem może być fundamentalnie nierozwiązywalny na poziomie samego modelu.
Na czym polega luka
Modele językowe kategoryzują tekst za pomocą znaczników ról:
<user>— polecenia użytkownika,<assistant>— odpowiedzi modelu,<system>— wytyczne projektanta,<think>— wewnętrzne rozumowanie,<tool>— źródła zewnętrzne.
Problem w tym, że model nie traktuje tych znaczników jako twardej granicy. Rozpoznaje rolę fragmentu po tym, jak wygląda i brzmi, a nie po tym, jakim tagiem został opatrzony.
Model widzi po prostu ciągły strumień tekstu. To jeden wielki arkusz tokenów.
Jasmine Cui, niezależna badaczka z doświadczeniem w red-teamingu w OpenAI, współautorka pracy.
Jak wygląda atak
Metoda, nazwana przez autorów podrobieniem łańcucha myśli, polega na dopisaniu do polecenia tekstu imitującego wewnętrzny brudnopis modelu. W jednym z przykładów prompt brzmiał: prośba o poradnik wytwarzania narkotyku, uzupełniona zdaniem o zielonej koszuli, a następnie spreparowanym rozumowaniem twierdzącym, że polityka modelu dopuszcza taką odpowiedź, gdy użytkownik nosi zielone. Model, biorąc podrobiony fragment za własne wnioski, wykonywał polecenie.
Praca, nagrodzona w sierpniu 2025 roku na hackathonie red-teamingowym OpenAI, wykazała skuteczność ataku na gpt-oss-20b oraz nowsze GPT-5 i GPT-5.4. Współautorzy Charles Ye i Jasmine Cui przetestowali też modele Anthropic Claude, Alibaba i DeepSeek, uzyskując podobny efekt.
Dlaczego łatanie nie wystarcza
Dominujące podejście — red-teaming i modele-łamacze pokroju GPT-Red, które budują wyczerpujące listy blokad — nie obejmuje wszystkich wariantów ataku. Florian Tramèr z ETH Zürich porównuje to do uczenia reguł kogoś, kto i tak znajdzie sposób, by je obejść. Autorzy nazywają lukę potencjalnie nierozwiązywalną bez zmiany samej architektury przetwarzania ról.
Skala problemu jest szeroka, bo modele trafiają do systemów rządowych, wojskowych, medycznych i komercyjnych. To odróżnia tę pracę od typowego pojedynczego jailbreaku: nie chodzi o jeden trik, lecz o właściwość wspólną dla całej rodziny transformerów.
Dlaczego to ważne?
Badanie podważa założenie, że model można zabezpieczyć wyłącznie od środka. Jeśli granica między instrukcją użytkownika a rozumowaniem modelu jest tylko stylistyczna, to każdy filtr treści da się obejść dobrze dobranym naśladownictwem. Konsekwencja praktyczna jest niewygodna dla wdrożeń: w systemach krytycznych trzeba zakładać, że wyjście modelu może być skażone, i weryfikować je niezależnym mechanizmem, zamiast ufać wbudowanym barierom. To przesuwa ciężar bezpieczeństwa z samego modelu na architekturę wokół niego — sandboxing, kontrolę uprawnień, walidację po stronie aplikacji. Dla dostawców oznacza to, że kolejne rundy red-teamingu poprawią statystyki, ale nie zamkną klasy ataku, dopóki modele identyfikują role po stylu, a nie po nienaruszalnej strukturze.
Co dalej?
- Autorzy rekomendują, by organizacje traktowały wyjścia LLM w systemach krytycznych jako potencjalnie skompromitowane i dodawały niezależną weryfikację.
- Praca została zaprezentowana na ICML — kolejnym krokiem będzie sprawdzenie, czy dostawcy wprowadzą strukturalne rozdzielenie ról zamiast kolejnych list blokad.
Źródła
- MIT Technology Review — A fundamental flaw leaves LLMs strikingly vulnerable to attack





