Akceleratory łączą wiele wyspecjalizowanych jednostek obliczeniowych (np. rdzenie Tensor, macierze systoliczne) działających równolegle, wspierają obniżone precyzje (FP16/BF16/FP8/FP4/INT8) oraz szybką pamięć o dużej przepustowości (HBM), aby maksymalizować liczbę operacji na wat i na sekundę.
Procesory ogólnego przeznaczenia (CPU) są nieefektywne dla masowo równoległych operacji tensorowych sieci neuronowych, co ogranicza szybkość i podnosi koszty energii trenowania oraz inferencji.