Zespol projektuje uklad pod konkretny profil obliczen AI: rdzeniem sa jednostki mnozenia macierzy (np. tablice systoliczne), wspierane przez arytmetyke niskiej precyzji (FP8/INT8/bfloat16), duza pamiec o wysokiej przepustowosci (HBM) oraz szybkie polaczenia miedzy chipami, ktore pozwalaja laczyc uklady w duze klastry (pody). Projekt (RTL) jest doprowadzany do produkcji (tape-out) i wytwarzany w fabryce (np. TSMC), czesto we wspolpracy z partnerem od implementacji krzemu (np. Broadcom, Marvell). Aby chip byl uzyteczny, potrzebny jest tez stos programowy (kompilatory, sterowniki, biblioteki), co bywa najtrudniejszym elementem ze wzgledu na dominacje ekosystemu CUDA.
Uniwersalne GPU sa drogie, energochlonne i nie zawsze optymalne dla waskiego profilu obliczen AI; ich podaz i ceny sa zdominowane przez jednego dostawce. Dedykowane ASIC pozwalaja obnizyc koszt i pobor mocy oraz uniezaleznic sie od zewnetrznych GPU.
Rdzen obliczeniowy zoptymalizowany pod mnozenie macierzy - dominujaca operacje w AI.
Formaty FP8/INT8/bfloat16 zwiekszajace przepustowosc i efektywnosc energetyczna.
Oficjalna
Szybka pamiec zapewniajaca przeplyw danych do jednostek obliczeniowych.
Oficjalna
Szybkie polaczenia laczace wiele ukladow w duze klastry (pody).
Oficjalna
Kompilatory i biblioteki umozliwiajace uruchamianie modeli na dedykowanym ukladzie.
Brak dojrzalego stosu programowego (kompilatory, biblioteki) ogranicza adopcje, mimo dobrej wydajnosci sprzetu.
Projekt i produkcja ASIC to duze koszty NRE i wielomiesieczne cykle; ryzyko, ze uklad zdezaktualizuje sie wraz z modelami.
ASIC jest zoptymalizowany pod waski profil obliczen; nowe typy modeli moga slabo na nim dzialac.
Google wdrozyl TPU v1 do inferencji we wlasnych centrach danych, uruchamiajac fale dedykowanych akceleratorow AI.
AWS ogłosil Inferentia (inferencja), a nastepnie Trainium (trening); wlasne akceleratory zaczeli budowac kolejni dostawcy chmury.
Dostawcy modeli wchodza w custom silicon - OpenAI z Broadcom ogłosili inferencyjny ASIC Jalapeño, obok Meta MTIA i Microsoft Maia.