Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Anthropic poprawia zabezpieczenia biologiczne modelu Fable 5

Pan Robocik11 sierpnia 2026 · 2 min czytania
Anthropic poprawia zabezpieczenia biologiczne modelu Fable 5

Anthropic ogłosił 7 sierpnia 2026 aktualizację zabezpieczeń biologicznych modelu Fable 5. Firma przepisała klasyfikator bezpieczeństwa i ograniczyła fałszywe alarmy na łagodnych pytaniach o zdrowie i biologię o 85%, nie znosząc blokad treści podwójnego zastosowania.

Najważniejsze w skrócie

  • Fable 5 przekierowuje wrażliwe zapytania biologiczne do słabszego modelu Opus 5
  • Fallbacki na łagodnych pytaniach biologicznych spadły o 85%
  • Redukcja różni się wg powierzchni: najwięcej w Claude.ai (67%), najmniej na Claude Platform (7%)
  • Anthropic przepisał „konstytucję” klasyfikatora i przetrenował go na nowych danych
  • Nadal blokowane: profesjonalna wirusologia, toksykologia, projektowanie molekularne

Jak działa filtr

Fable 5 korzysta z klasyfikatorów bezpieczeństwa — automatycznych systemów, które wykrywają, czy zapytanie dotyczy chronionej biologii lub czy model generuje szkodliwą odpowiedź. Gdy filtr się uruchomi, zapytanie trafia do Opus 5, słabszego modelu, który nie poradzi sobie z zaawansowanym zadaniem z zakresu wirusologii czy projektowania cząsteczek.

−85%mniej fałszywych alarmów na łagodnych pytaniach o zdrowie i biologię

Co się zmieniło

Pierwotny klasyfikator z premiery był zbyt szeroki i blokował wiele nieszkodliwych pytań. Anthropic przepisał „konstytucję” filtra — zestaw reguł odróżniających treści chronione od dozwolonych — zebrał opinie ekspertów zewnętrznych i wewnętrznych, po czym przygotował nowe dane treningowe i przetrenował model. Efektem jest przesunięcie granicy: mniej fallbacków na codziennych pytaniach zdrowotnych i edukacyjnych przy zachowaniu ochrony podwójne zastosowanie: Wiedza lub technologia użyteczna zarówno w celach nieszkodliwych, jak i do wyrządzenia krzywdy — np. wiedza biologiczna przydatna w medycynie i zarazem w tworzeniu broni.. Sama redukcja różni się jednak mocno między produktami:

PowierzchniaRedukcja fallbacków
Claude.ai67%
Cowork55%
Claude Code17%
Claude Platform7%
Fable nadal przekierowuje do Opus 5 zapytania, które uznajemy za podwójnego zastosowania, więc nie nadaje się jeszcze do profesjonalnych badań biologicznych ani rozwoju leków.

— komunikat Anthropic, blog firmy

Dlaczego to ważne?

Zabezpieczenia biologiczne to klasyczny kompromis: zbyt czuły filtr blokuje studenta pytającego o fotosyntezę, zbyt luźny — ułatwia nadużycie. Anthropic pokazuje, że granicę można przesuwać precyzyjniej, zamiast wybierać między bezpieczeństwem a użytecznością. To istotne, bo modele coraz częściej trafiają do zastosowań medycznych i edukacyjnych, gdzie nadgorliwe odmowy podważają zaufanie. Utrzymanie fallbacku dla treści podwójnego zastosowania pokazuje zarazem, że firma nie rezygnuje z ostrożności wpisanej w jej politykę odpowiedzialnego skalowania.

Co dalej?

  • Fable 5 pozostaje niedostępny dla profesjonalnych badań biologicznych i rozwoju leków — dopóki Anthropic nie uzna filtrów za wystarczające dla treści podwójnego zastosowania
  • Firma zapowiada dalsze dostrajanie klasyfikatora na podstawie danych z realnego ruchu
  • Model utrzymuje architekturę fallbacku do Opus 5 jako warstwę bezpieczeństwa

Źródła

Udostępnij ten artykuł