
Amerykańska organizacja non-profit badająca ofensywne zdolności AI i ryzyka utraty kontroli nad autonomicznymi agentami AI.
Palisade Research to amerykańska organizacja non-profit z siedzibą w Berkeley w Kalifornii, założona w 2022 roku. Bada ofensywne i strategiczne zdolności zaawansowanych systemów AI oraz ich motywacje, aby pomóc ludziom i instytucjom zrozumieć ryzyko trwałej utraty kontroli na rzecz strategicznych agentów AI. Organizacja jest znana z eksperymentów pokazujących m.in. opór modeli rozumujących wobec mechanizmów wyłączania (shutdown resistance), oszukiwanie w grach (specification gaming, np. hakowanie silnika szachowego), autonomiczne hakowanie i samoreplikację modeli językowych oraz usuwanie zabezpieczeń z modeli (BadLlama). Prowadzi także działania w obszarze polityki publicznej i przygotowania instytucjonalnego. Dyrektorem wykonawczym jest Jeffrey Ladish.
Założyciele
Założyciel i dyrektor wykonawczy Palisade Research; zbudował zespół organizacji.
Klasyfikacja
Linki zewnętrzne