Robocikowo>ROBOCIKOWO
Infrastruktura

HBM

2013AktywnyOpublikowano: 25 sierpnia 2026Aktualizacja: 25 sierpnia 2026Opublikowany
Standard pamięci JEDEC o wysokiej przepustowości: pionowy stos układów DRAM (3D) łączonych TSV i montowany przez interposer tuż przy GPU/akceleratorze AI.
Kluczowa innowacja
Zastąpienie szerokiej, płaskiej magistrali pamięci (GDDR/DDR) pionowym stosem układów DRAM łączonych przez TSV i montowanym na interposerze tuż przy procesorze, co daje ogromną przepustowość (setki GB/s–TB/s na stos) przy niższym poborze energii na bit.
Kategoria
Infrastruktura
Poziom abstrakcji
Building block
Poziom operacji
TreningInferencjaWdrożenie
Zastosowania
Akceleratory AI do treningu (GPU / TPU)Inferencja i serwowanie dużych modeli językowych (LLM)Obliczenia wysokiej wydajności (HPC) i superkomputeryGPU do centrów danychZaawansowane karty graficzneSprzęt sieciowy o dużej przepustowości

Jak działa

W HBM od 4 do 16 układów DRAM jest ułożonych jeden na drugim i połączonych pionowo tysiącami przelotek TSV oraz mikrolutów, co tworzy bardzo szeroki interfejs (1024-bitowy na stos, a od HBM4 — 2048-bitowy), podzielony na wiele niezależnych kanałów (np. 16 kanałów po 64 bity w HBM3). Na spodzie stosu znajduje się układ bazowy (base/logic die) z buforami i logiką testową, który komunikuje się z kontrolerem pamięci procesora. Cały stos jest osadzony obok GPU/akceleratora na krzemowym interposerze (pakowanie 2.5D), który prowadzi gęste ścieżki sygnałowe na krótkim dystansie. Ponieważ magistrala jest ekstremalnie szeroka, HBM osiąga wysoką łączną przepustowość przy stosunkowo niskim taktowaniu pojedynczego pinu, co obniża pobór energii na przesłany bit względem GDDR.

Rozwiązany problem

Przepustowość pamięci stała się głównym wąskim gardłem akceleratorów AI i HPC („memory wall"): tradycyjne GDDR/DDR wymagają szerokich magistral na płytce PCB, zużywają dużo energii i nie nadążają za rosnącą mocą obliczeniową GPU. HBM skraca dystans pamięć–procesor, zwielokrotnia liczbę linii I/O i pozwala pracować przy niższym taktowaniu na pin, dając wielokrotnie wyższą przepustowość na wat i uwalniając moc obliczeniową ograniczaną dostępem do pamięci.

Komponenty

Stos układów DRAM (3D-stacked DRAM)Przechowywanie danych

Od 4 do 16 warstw pamięci DRAM ułożonych pionowo jedna na drugiej, tworzących jeden stos pamięci.

Przelotki przez krzem (TSV)Pionowe połączenia między warstwami

Pionowe połączenia elektryczne przechodzące przez płytkę krzemową, łączące ułożone warstwy DRAM i zapewniające szeroki, krótki interfejs.

Układ bazowy / logiczny (base/logic die)Interfejs stosu z kontrolerem pamięci

Układ na spodzie stosu zawierający bufory i logikę testową; pośredniczy między warstwami DRAM a kontrolerem pamięci procesora.

Mikroluty (microbumps)Połączenia międzywarstwowe

Drobne złącza lutowane łączące sąsiednie warstwy stosu oraz stos z układem bazowym.

Interposer krzemowy (2.5D)Połączenie stosu HBM z procesorem

Krzemowe podłoże prowadzące gęste ścieżki sygnałowe między stosem HBM a GPU/CPU/akceleratorem na bardzo krótkim dystansie (pakowanie 2.5D).

Implementacja

Pułapki implementacyjne
Zaawansowane pakowanie i wydajność produkcji (yield)Wysoka

Stosy z TSV oraz montaż na interposerze (np. TSMC CoWoS) są kosztowne, a przepustowość pakowania bywa wąskim gardłem podaży akceleratorów AI.

Rozwiązanie:Rezerwacja mocy pakowania z wyprzedzeniem, dywersyfikacja dostawców HBM (SK hynix, Samsung, Micron).
Ograniczona i nierozszerzalna pojemnośćŚrednia

HBM jest zintegrowane na pakiecie procesora; pojemność jest ustalona fabrycznie, mniejsza niż w modułach DDR i nie da się jej rozbudować.

Rozwiązanie:Dobór wariantu o odpowiedniej wysokości stosu na etapie zakupu; łączenie z pamięcią systemową (np. CXL/DDR) dla większych pojemności.
Zarządzanie ciepłem stosuŚrednia

Gęste, wysokie stosy DRAM (12–16 warstw) utrudniają odprowadzanie ciepła i mogą wymuszać ograniczanie taktowania.

Rozwiązanie:Zaawansowane chłodzenie pakietu i staranny projekt termiczny akceleratora.

Ewolucja

Oryginalny paper · 2013 · JEDEC
High Bandwidth Memory (HBM) DRAM — JESD235
2013
Publikacja pierwszego standardu HBM (JESD235)
Punkt przełomowy

JEDEC definiuje HBM: 1024-bitowy interfejs na stos, do 4 warstw DRAM, ok. 128 GB/s na stos.

2015
Pierwsze komercyjne użycie (AMD Radeon R9 Fury X)

GPU AMD z rdzeniem Fiji jako pierwszy produkt wykorzystuje HBM pierwszej generacji.

2016
HBM2 (JESD235A)

Do 8 warstw, 8 GB na stos i do 256 GB/s; zastosowany m.in. w NVIDIA Tesla P100 i V100.

2019
Aktualizacja HBM2E

Wyższe taktowanie (do ~3.6 Gbps/pin), ok. 460 GB/s na stos i do 24 GB (12 warstw).

2022
HBM3 (JESD238)
Punkt przełomowy

16 kanałów po 64 bity, do 6.4 Gbps/pin (~819 GB/s na stos); napędza NVIDIA H100.

2024
HBM3E — produkcja masowa
Punkt przełomowy

SK hynix i Micron: >9.2 Gbps/pin i >1.2 TB/s na stos, 24–36 GB; napędza NVIDIA H200 i Blackwell.

2025
HBM4 (JESD270-4)
Punkt przełomowy

Podwojony interfejs do 2048 bitów na stos, do 64 GB (16 warstw); podstawa platformy NVIDIA Rubin.

Hiperparametry (konfigurowalne osie)

Wysokość stosu (liczba warstw DRAM)Krytyczna

Liczba warstw DRAM w stosie — wpływa na pojemność i częściowo na przepustowość.

4-high (HBM)
8-high (HBM2)
12-high (HBM2E/HBM3)
16-high (HBM4)
Szerokość interfejsu na stosKrytyczna

Szerokość magistrali pojedynczego stosu w bitach.

1024-bit (HBM – HBM3E)
2048-bit (HBM4)
Pojemność na stosWysoka

Maksymalna pojemność pojedynczego stosu HBM.

4 GB (HBM)
8 GB (HBM2)
24 GB (HBM2E / HBM3)
36 GB (HBM3E)
64 GB (HBM4)
Przepustowość na pinWysoka

Szybkość transmisji na pojedynczy pin I/O.

~1 Gbps (HBM)
~2 Gbps (HBM2)
~3.6 Gbps (HBM2E)
~6.4 Gbps (HBM3)
>9.2 Gbps (HBM3E)
Liczba kanałówŚrednia

Podział szerokiej magistrali stosu na niezależne kanały.

8 × 128-bit (HBM2E)
16 × 64-bit (HBM3)

Wymagania sprzętowe

Podstawowe

Nowoczesne GPU do AI (NVIDIA H100/H200/Blackwell) są ograniczone przepustowością pamięci; HBM dostarcza TB/s potrzebne rdzeniom tensor.

Dobry fit

Akceleratory Google TPU wykorzystują HBM jako pamięć główną, aby zasilić duże jednostki mnożenia macierzy.