Techniki obejmują m.in. uczenie ze wzmocnieniem z informacją zwrotną od ludzi (RLHF) i od AI (RLAIF), constitutional AI, nadzór skalowalny, interpretowalność, red-teaming oraz ewaluacje zdolności i zagrożeń (np. prace METR i Palisade Research).
Trudno precyzyjnie zakodować ludzkie intencje i wartości w celu optymalizacyjnym; źle wyrównane, zdolne systemy mogą działać w sposób niepożądany lub niebezpieczny.