Robocikowo>ROBOCIKOWO
Wnioskowanie

LPU

2020AktywnyAktualizacja: 19 sierpnia 2026Opublikowany
Autorski akcelerator AI firmy Groq do inferencji LLM: deterministyczna architektura dataflow z pamięcią SRAM na układzie, zapewniająca bardzo wysoką przepustowość tokenów i przewidywalnie niską latencję.
Kluczowa innowacja
Deterministyczny procesor dataflow (Tensor Streaming Processor) zaprojektowany przez Groq wyłącznie pod inferencję modeli językowych: bez pamięci HBM i mechanizmów reaktywnych, z pamięcią SRAM na układzie i harmonogramem sterowanym w pełni przez kompilator — co daje bardzo niską i przewidywalną latencję.
Kategoria
Wnioskowanie
Poziom abstrakcji
Paradygmat
Poziom operacji
InferencjaUdostępnianie
Zastosowania
Inferencja LLM o niskiej latencji (interaktywne czaty, agenci)Serwowanie modeli o wysokiej przepustowości tokenówZastosowania wymagające przewidywalnej latencji (real-time)Chmura inferencyjna (GroqCloud) i wdrożenia on-premise (GroqRack)

Jak działa

Kompilator Groq z góry planuje każdą operację i każdy transfer danych w czasie (statyczne, deterministyczne szeregowanie), więc układ nie potrzebuje pamięci podręcznych ani predykcji rozgałęzień. Dane przepływają przez macierze jednostek obliczeniowych (mnożenia macierzy, funkcje wektorowe) w ustalonym rytmie, a wagi i aktywacje rezydują w szybkiej pamięci SRAM na układzie. Dla dużych modeli wiele układów LPU łączy się w sieć o deterministycznej komunikacji, co pozwala skalować model przy zachowaniu przewidywalnej latencji. Efektem jest bardzo szybka, powtarzalna generacja tokenów.

Rozwiązany problem

Inferencja LLM na GPU jest ograniczona przepustowością pamięci (HBM) i cierpi na zmienną latencję przez reaktywne, niedeterministyczne wykonanie. LPU rozwiązuje to deterministycznym dataflow i pamięcią SRAM na układzie, dając przewidywalnie niską latencję i wysoką przepustowość.

Kluczowe mechanizmy

Tensor Streaming Processor (TSP) — architektura dataflow
W pełni deterministyczne, planowane przez kompilator wykonanie
Pamięć SRAM na układzie zamiast HBM
Brak pamięci podręcznych i predykcji rozgałęzień
Deterministyczna sieć wielu układów dla dużych modeli

Mocne strony i ograniczenia

Mocne strony
✓Bardzo niska i przewidywalna latencja
✓Wysoka przepustowość tokenów
✓Determinizm ułatwiający optymalizację i SLA
✓Eliminacja wąskiego gardła HBM w dekodowaniu
Ograniczenia
✗Mała pamięć SRAM na układ → duże modele wymagają wielu układów
✗Wyspecjalizowany pod inferencję (nie do treningu)
✗Uzależnienie od kompilatora i statycznego harmonogramu
✗Ekosystem węższy niż CUDA/GPU

Komponenty

Tensor Streaming Processor (TSP)Rdzeń obliczeniowy

Rdzeń dataflow wykonujący operacje w deterministycznym, planowanym rytmie.

Pamięć SRAM na układziePamięć

Duża, szybka pamięć na wagi i aktywacje zamiast HBM.

Kompilator (statyczny harmonogram)Sterowanie wykonaniem

Planuje z góry każdą operację i transfer danych.

Deterministyczna sieć układówSkalowanie

Łączy wiele LPU dla dużych modeli z przewidywalną komunikacją.

Oficjalna

Implementacja

Pułapki implementacyjne
Ograniczona pamięć SRAM na układŚrednia

Duże modele wymagają rozłożenia na wiele układów LPU.

Rozwiązanie:Sieć wielu układów, partycjonowanie modelu, kwantyzacja.
Zależność od kompilatoraŚrednia

Wydajność i poprawność zależą od statycznego harmonogramu kompilatora.

Rozwiązanie:Dojrzały toolchain, testy i profilowanie.

Ewolucja

Oryginalny paper · 2020 · ISCA 2020 · Dennis Abts
Think Fast: A Tensor Streaming Processor (TSP) for Accelerating Deep Learning Workloads
Dennis Abts, i in. (Groq)
2016
Powstanie Groq

Jonathan Ross (współtwórca Google TPU) zakłada Groq.

2020
Publikacja architektury TSP (ISCA)
Punkt przełomowy

Groq opisuje Tensor Streaming Processor — deterministyczny procesor dataflow.

2024
LPU w chmurze GroqCloud
Punkt przełomowy

Inferencja LLM na LPU trafia do głównego nurtu dzięki GroqCloud.

Hiperparametry (konfigurowalne osie)

Liczba układówWysoka
wiele LPUDuże modele rozkładane na sieć układów.
PrecyzjaŚrednia
FP16/INT8Format obliczeń wpływa na przepustowość i pamięć.

Paradygmat wykonania

Tryb główny
Gęsty

Wykonanie jest gęste i w pełni deterministyczne (statyczny harmonogram kompilatora), bez reaktywnych mechanizmów sprzętowych.

Wzorzec aktywacji
Wszystkie ścieżki aktywne

Równoległość

Poziom równoległości
Częściowo równoległy

Równoległość na poziomie macierzy obliczeniowych i wielu układów; dekodowanie autoregresyjne pozostaje sekwencyjne po tokenach.

Zakres
InferencjaPomiędzy urządzeniami