GPT-Red: OpenAI wytrenowało AI do łamania innych modeli AI
OpenAI wytrenowało GPT-Red — model AI wyspecjalizowany w łamaniu innych modeli przez prompt injection. GPT-Red osiągnął 84% skuteczności ataków wobec 13% ludzkich red-teamerów i pomógł uodpornić GPT-5.6 Sol do poziomu 0,05% skuteczności ataków.