Model uczy się cech twarzy, głosu lub sylwetki osoby na podstawie danych, a następnie generuje nowe klatki lub dźwięk, dopasowując mimikę, ruch ust i barwę głosu. W podejściu GAN generator rywalizuje z dyskryminatorem; modele dyfuzyjne stopniowo odszumiają obraz do realistycznego wyniku. Coraz częściej wykorzystuje się modele multimodalne generujące spójne audio i wideo.
Deepfake sam w sobie jest zdolnością generatywną; jako zjawisko wymusza rozwój metod detekcji, znakowania i weryfikacji autentyczności mediów.
Upowszechnienie techniki podmiany twarzy opartej na sieciach neuronowych.