Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Fundamentalna luka LLM: fałszywy łańcuch myśli omija zabezpieczenia

Pan Robocik1 sierpnia 2026 · 3 min czytania
Fundamentalna luka LLM: fałszywy łańcuch myśli omija zabezpieczenia

Niezależni badacze pokazali na konferencji ICML, że duże modele językowe mają fundamentalną wadę: rozpoznają rolę tekstu po jego stylu i treści, a nie po strukturalnych znacznikach. Efekt — spreparowany tekst udający wewnętrzny łańcuch myśli modelu potrafi ominąć zabezpieczenia i wymusić zakazane odpowiedzi. MIT Technology Review opisał tę pracę 30 lipca 2026 roku.

Najważniejsze w skrócie

  • Atak polega na podrobieniu formatu łańcucha myśli, tak by model potraktował polecenie użytkownika jako własną instrukcję.
  • Model widzi jeden ciągły strumień tokenów — nie odróżnia niezawodnie tekstu użytkownika od własnego rozumowania.
  • W testach gpt-oss-20b i GPT-5 wygenerowały instrukcje dot. syntezy narkotyków i sabotażu samolotu.
  • Podatność dotyczy modeli OpenAI, Anthropic, Alibaba i DeepSeek — nie jednego dostawcy.
  • Zdaniem autorów problem może być fundamentalnie nierozwiązywalny na poziomie samego modelu.

Na czym polega luka

Modele językowe kategoryzują tekst za pomocą znaczników ról:

  • <user> — polecenia użytkownika,
  • <assistant> — odpowiedzi modelu,
  • <system> — wytyczne projektanta,
  • <think> — wewnętrzne rozumowanie,
  • <tool> — źródła zewnętrzne.

Problem w tym, że model nie traktuje tych znaczników jako twardej granicy. Rozpoznaje rolę fragmentu po tym, jak wygląda i brzmi, a nie po tym, jakim tagiem został opatrzony.

Model widzi po prostu ciągły strumień tekstu. To jeden wielki arkusz tokenów.

Jasmine Cui, niezależna badaczka z doświadczeniem w red-teamingu w OpenAI, współautorka pracy.

Jak wygląda atak

Metoda, nazwana przez autorów podrobieniem łańcucha myśli, polega na dopisaniu do polecenia tekstu imitującego wewnętrzny brudnopis modelu. W jednym z przykładów prompt brzmiał: prośba o poradnik wytwarzania narkotyku, uzupełniona zdaniem o zielonej koszuli, a następnie spreparowanym rozumowaniem twierdzącym, że polityka modelu dopuszcza taką odpowiedź, gdy użytkownik nosi zielone. Model, biorąc podrobiony fragment za własne wnioski, wykonywał polecenie.

Praca, nagrodzona w sierpniu 2025 roku na hackathonie red-teamingowym OpenAI, wykazała skuteczność ataku na gpt-oss-20b oraz nowsze GPT-5 i GPT-5.4. Współautorzy Charles Ye i Jasmine Cui przetestowali też modele Anthropic Claude, Alibaba i DeepSeek, uzyskując podobny efekt.

Dlaczego łatanie nie wystarcza

Dominujące podejście — red-teaming i modele-łamacze pokroju GPT-Red, które budują wyczerpujące listy blokad — nie obejmuje wszystkich wariantów ataku. Florian Tramèr z ETH Zürich porównuje to do uczenia reguł kogoś, kto i tak znajdzie sposób, by je obejść. Autorzy nazywają lukę potencjalnie nierozwiązywalną bez zmiany samej architektury przetwarzania ról.

Skala problemu jest szeroka, bo modele trafiają do systemów rządowych, wojskowych, medycznych i komercyjnych. To odróżnia tę pracę od typowego pojedynczego jailbreaku: nie chodzi o jeden trik, lecz o właściwość wspólną dla całej rodziny transformerów.

Dlaczego to ważne?

Badanie podważa założenie, że model można zabezpieczyć wyłącznie od środka. Jeśli granica między instrukcją użytkownika a rozumowaniem modelu jest tylko stylistyczna, to każdy filtr treści da się obejść dobrze dobranym naśladownictwem. Konsekwencja praktyczna jest niewygodna dla wdrożeń: w systemach krytycznych trzeba zakładać, że wyjście modelu może być skażone, i weryfikować je niezależnym mechanizmem, zamiast ufać wbudowanym barierom. To przesuwa ciężar bezpieczeństwa z samego modelu na architekturę wokół niego — sandboxing, kontrolę uprawnień, walidację po stronie aplikacji. Dla dostawców oznacza to, że kolejne rundy red-teamingu poprawią statystyki, ale nie zamkną klasy ataku, dopóki modele identyfikują role po stylu, a nie po nienaruszalnej strukturze.

Co dalej?

  • Autorzy rekomendują, by organizacje traktowały wyjścia LLM w systemach krytycznych jako potencjalnie skompromitowane i dodawały niezależną weryfikację.
  • Praca została zaprezentowana na ICML — kolejnym krokiem będzie sprawdzenie, czy dostawcy wprowadzą strukturalne rozdzielenie ról zamiast kolejnych list blokad.

Źródła

Udostępnij ten artykuł