Robocikowo>ROBOCIKOWO
GoogleWdrożony

Google TPU Trillium (v6e)

Trillium to szósta generacja akceleratora AI (TPU v6e) firmy Google, czyli dedykowany układ ASIC do przyspieszania obliczeń sieci neuronowych w treningu i inferencji. Pojedynczy chip oferuje szczytową wydajność 918 TFLOPs w formacie bfloat16 oraz 1836 TOPS w int8, 32 GB pamięci HBM o przepustowości 1638 GB/s oraz dwukierunkowe łącze międzychipowe (ICI) 800 GB/s przez 4 porty. Chip zawiera jeden TensorCore z dwiema jednostkami mnożenia macierzy (MXU).

Chipy łączone są w pody po 256 sztuk (topologia 2D torus, maks. konfiguracja 16x16), po 8 chipów na hosta. Google udostępnia je jako Cloud TPU w konfiguracjach VM od 1 do 8 chipów. W ramach sieci Jupiter można połączyć do 100 tys. chipów Trillium (przepustowość bisekcyjna 13 Pb/s), z 99% efektywnością skalowania na 12 podach (3072 chipy) i 94% na 24 podach (6144 chipy) dla pretreningu GPT3-175B.

Względem poprzedniej generacji v5e Trillium zapewnia 4,7x wyższą szczytową wydajność obliczeniową na chip, do 4x szybszy trening i do 3x wyższą przepustowość inferencji, dwukrotnie większą pojemność i przepustowość HBM oraz dwukrotnie szerszy interfejs ICI, przy 67% wyższej efektywności energetycznej. Trillium stał się ogólnie dostępny (GA) 12 grudnia 2024 r.

#akcelerator AI#ASIC#TPU#Trillium#v6e#bfloat16#Google Cloud#uczenie maszynowe#inferencja
Klasa rynkowaPrzemysłowy
Data wprowadzenia12 grudnia 2024

Klasyfikacja

Akcelerator AI · pełni rolę: Akceleracja AI, Wnioskowanie AI, Obliczenia.

Do jakiej grupy należy Google TPU Trillium (v6e) i jak jest skonstruowany

5pozycji
Obliczenia
Domena hardware
Przemysłowy
Klasa rynkowa

Podkategoria zbiera układy scalone przeznaczone do przyspieszania obliczeń AI w centrach danych: NVIDIA H100/B200, Google TPU, AWS Trainium/Inferentia, Meta MTIA, Groq LPU, Cerebras WSE. Wspólne cechy: pamięć HBM o wysokiej przepustowości, tryby niskiej precyzji (FP16/BF16/FP8/MX8/MX4/INT8/INT4), skalowalność do rack-scale (setki chipów w jednej domenie scale-up), chłodzenie cieczą, integracja z frameworkami ML (PyTorch, JAX, Triton, vLLM). Kontrastuje z hardwareSubcategory.ai-soc-edge-ai-soc — tam kryteria są odwrotne (niski pobór mocy, brak HBM, on-device inferencja).

AI Accelerator to wyspecjalizowany komponent sprzętowy zaprojektowany do wydajnego wykonywania obliczeń związanych ze sztuczną inteligencją, w szczególności inferencji sieci neuronowych, przetwarzania wizji komputerowej i analizy danych sensorycznych. W robotyce akceleratory AI są używane do uruchamiania modeli percepcji, rozpoznawania obiektów, segmentacji obrazu, planowania i innych zadań wymagających wysokiej mocy obliczeniowej przy ograniczonych zasobach energetycznych. Mogą występować jako dedykowane układy NPU, TPU, VPU, GPU lub specjalizowane moduły embedded.

Karta akceleratora AI data-center to klasa konstrukcyjna opisująca budowę wysokowydajnych procesorów obliczeniowych (GPU/akceleratorów) przeznaczonych do montażu w serwerach centrów danych. Charakteryzuje się: form factorem SXM (moduł lutowany do płyty bazowej HGX/DGX) lub dwuslotową kartą PCIe; pamięcią o wysokiej przepustowości (HBM2e/HBM3/HBM3e) zintegrowaną na pakiecie; dedykowanymi łączami GPU-GPU (NVLink, Infinity Fabric) o przepustowości setek GB/s; wysokim TDP (350–1000 W) wymagającym chłodzenia powietrznego lub cieczowego; obsługą wirtualizacji/partycjonowania (MIG) oraz formatów obliczeniowych niskiej precyzji (FP8/FP16/BF16/INT8). Klasa obejmuje konstrukcje takie jak NVIDIA H100/H200/A100, AMD Instinct MI300, Google TPU, Intel Gaudi. Opisuje budowę i konfigurację fizyczną, nie rolę funkcjonalną (tą określa typ komponentu „Akcelerator AI").

Specyfikacja techniczna

Wydajność obliczeniowa
3parametry
Szczytowa wydajność (bf16)
918 TFLOPs

na chip

Szczytowa wydajność (Int8)
1836 TOPS

na chip

TensorCore / MXU
1 TensorCore, 2 MXU

na chip

Aktualizacja: 29 września 2026