Google TPU Trillium (v6e)
Trillium to szósta generacja akceleratora AI (TPU v6e) firmy Google, czyli dedykowany układ ASIC do przyspieszania obliczeń sieci neuronowych w treningu i inferencji. Pojedynczy chip oferuje szczytową wydajność 918 TFLOPs w formacie bfloat16 oraz 1836 TOPS w int8, 32 GB pamięci HBM o przepustowości 1638 GB/s oraz dwukierunkowe łącze międzychipowe (ICI) 800 GB/s przez 4 porty. Chip zawiera jeden TensorCore z dwiema jednostkami mnożenia macierzy (MXU).
Chipy łączone są w pody po 256 sztuk (topologia 2D torus, maks. konfiguracja 16x16), po 8 chipów na hosta. Google udostępnia je jako Cloud TPU w konfiguracjach VM od 1 do 8 chipów. W ramach sieci Jupiter można połączyć do 100 tys. chipów Trillium (przepustowość bisekcyjna 13 Pb/s), z 99% efektywnością skalowania na 12 podach (3072 chipy) i 94% na 24 podach (6144 chipy) dla pretreningu GPT3-175B.
Względem poprzedniej generacji v5e Trillium zapewnia 4,7x wyższą szczytową wydajność obliczeniową na chip, do 4x szybszy trening i do 3x wyższą przepustowość inferencji, dwukrotnie większą pojemność i przepustowość HBM oraz dwukrotnie szerszy interfejs ICI, przy 67% wyższej efektywności energetycznej. Trillium stał się ogólnie dostępny (GA) 12 grudnia 2024 r.

Klasyfikacja
Akcelerator AI · pełni rolę: Akceleracja AI, Wnioskowanie AI, Obliczenia.
Do jakiej grupy należy Google TPU Trillium (v6e) i jak jest skonstruowany
Podkategoria zbiera układy scalone przeznaczone do przyspieszania obliczeń AI w centrach danych: NVIDIA H100/B200, Google TPU, AWS Trainium/Inferentia, Meta MTIA, Groq LPU, Cerebras WSE. Wspólne cechy: pamięć HBM o wysokiej przepustowości, tryby niskiej precyzji (FP16/BF16/FP8/MX8/MX4/INT8/INT4), skalowalność do rack-scale (setki chipów w jednej domenie scale-up), chłodzenie cieczą, integracja z frameworkami ML (PyTorch, JAX, Triton, vLLM). Kontrastuje z hardwareSubcategory.ai-soc-edge-ai-soc — tam kryteria są odwrotne (niski pobór mocy, brak HBM, on-device inferencja).
AI Accelerator to wyspecjalizowany komponent sprzętowy zaprojektowany do wydajnego wykonywania obliczeń związanych ze sztuczną inteligencją, w szczególności inferencji sieci neuronowych, przetwarzania wizji komputerowej i analizy danych sensorycznych. W robotyce akceleratory AI są używane do uruchamiania modeli percepcji, rozpoznawania obiektów, segmentacji obrazu, planowania i innych zadań wymagających wysokiej mocy obliczeniowej przy ograniczonych zasobach energetycznych. Mogą występować jako dedykowane układy NPU, TPU, VPU, GPU lub specjalizowane moduły embedded.
Karta akceleratora AI data-center to klasa konstrukcyjna opisująca budowę wysokowydajnych procesorów obliczeniowych (GPU/akceleratorów) przeznaczonych do montażu w serwerach centrów danych. Charakteryzuje się: form factorem SXM (moduł lutowany do płyty bazowej HGX/DGX) lub dwuslotową kartą PCIe; pamięcią o wysokiej przepustowości (HBM2e/HBM3/HBM3e) zintegrowaną na pakiecie; dedykowanymi łączami GPU-GPU (NVLink, Infinity Fabric) o przepustowości setek GB/s; wysokim TDP (350–1000 W) wymagającym chłodzenia powietrznego lub cieczowego; obsługą wirtualizacji/partycjonowania (MIG) oraz formatów obliczeniowych niskiej precyzji (FP8/FP16/BF16/INT8). Klasa obejmuje konstrukcje takie jak NVIDIA H100/H200/A100, AMD Instinct MI300, Google TPU, Intel Gaudi. Opisuje budowę i konfigurację fizyczną, nie rolę funkcjonalną (tą określa typ komponentu „Akcelerator AI").
Specyfikacja techniczna
na chip
na chip
na chip
na chip
Powiązania
Inne części sprzętowe powiązane z Google TPU Trillium (v6e)

TPU (Tensor Processing Unit) to autorski akcelerator AI (ASIC) Google do uczenia maszynowego, oparty na architekturze tablicy systolicznej (MXU, bfloat16). Dostepny w chmurze Google Cloud; wykorzystywany m.in. do trenowania modeli Gemini.

Architektura GPU NVIDII do AI (2024) i uklad B200: 208 mld tranzystorow, dwie matryce laczone 10 TB/s, TSMC 4NP, 192 GB HBM3e, 2. gen Transformer Engine (FP4) i 5. gen NVLink; podstawa systemow GB200.

Autorski akcelerator AI (ASIC) firmy Amazon/AWS do treningu i inferencji modeli AI; rdzenie NeuronCore, pamiec HBM, dostepny w instancjach EC2 (Trn). Trainium3: 144 GB HBM3e i 4,9 TB/s.