Przepustowość mierzy się jako liczbę wygenerowanych (lub przetworzonych) tokenów podzieloną przez czas, zwykle pod zadanym obciążeniem i rozmiarem batcha. Rośnie, gdy więcej żądań jest przetwarzanych równolegle (większy batch, continuous batching) oraz gdy lepiej wykorzystany jest sprzęt (mniejszy narzut pamięci KV dzięki PagedAttention/GQA, kwantyzacja, FlashAttention). Ponieważ faza dekodowania jest ograniczona przepustowością pamięci, batching pozwala amortyzować odczyt wag między wieloma żądaniami, podnosząc przepustowość — ale kosztem wyższej latencji pojedynczego żądania. Praktyczną miarą jest 'goodput': przepustowość tylko tych żądań, które mieszczą się w celach latencyjnych (SLA).
Wdrożenia LLM muszą obsłużyć wiele równoczesnych żądań przy akceptowalnym koszcie. Token Throughput jako metryka pozwala mierzyć i optymalizować skalę oraz koszt na token, niezależnie od latencji pojedynczego żądania.
Łączna liczba tokenów/s dla wszystkich równoczesnych żądań serwera.
Tokeny/s dostarczane pojedynczemu użytkownikowi (odwrotność TPOT).
Przepustowość liczona tylko dla żądań spełniających cele SLA (np. limity latencji).
Oficjalna
Bardzo duży batch podnosi tokeny/s, ale psuje responsywność pojedynczego żądania.
Wysoka surowa przepustowość może obejmować żądania łamiące limity latencji.
Pomiary przy stałej, idealnej długości sekwencji zawyżają przepustowość względem produkcji.
Produkcyjne serwowanie LLM stawia tokeny/s obok latencji jako główną metrykę wydajności i kosztu.
Radykalny wzrost przepustowości serwowania dzięki efektywnemu zarządzaniu KV cache i ciągłemu batchowaniu.
Optymalizacja przepustowości pod cele SLA (goodput) oraz oddzielne zasoby dla faz prefill i decode.
Złożoność czasowa: TP ≈ (batch × tokeny) / czas.
Główny czynnik przepustowości; większy batch = wyższa przepustowość, wyższa latencja.
Tensor/pipeline parallelism i liczba akceleratorów zwiększające przepustowość.
Niższa precyzja zwiększa przepustowość i zmniejsza zużycie pamięci.
Przepustowość ograniczona przepustowością pamięci (HBM) i mocą Tensor Cores; batching amortyzuje odczyt wag.
Akceleratory o dużej przepustowości pamięci osiągają wysoką przepustowość tokenów.