Wartości są mapowane z wyższej precyzji na niższą za pomocą skali (i punktu zerowego), często per-kanał lub per-grupa. Kwantyzację można wykonywać po treningu (PTQ, np. GPTQ, AWQ) lub uwzględniać w treningu (QAT); nowoczesne akceleratory wspierają formaty FP8/FP4 sprzętowo.
Duże modele wymagają ogromnej pamięci i przepustowości; pełna precyzja jest kosztowna i utrudnia wdrożenie na urządzeniach o ograniczonych zasobach.