Robocikowo>ROBOCIKOWO
Wnioskowanie

Token Throughput

2023AktywnyAktualizacja: 14 sierpnia 2026Opublikowany
Metryka wydajności: liczba tokenów przetwarzanych przez system w jednostce czasu (tokeny/s). Miara skali serwowania, w kompromisie z latencją.
Kluczowa innowacja
Ujmuje wydajność serwowania modelu jako tempo przetwarzania tokenów (tokeny/s) w skali systemu, dopełniając latencję i pozwalając optymalizować koszt i skalowalność wdrożenia.
Kategoria
Wnioskowanie
Poziom abstrakcji
Primitive
Poziom operacji
InferencjaUdostępnianie
Zastosowania
Planowanie pojemności i kosztu wdrożeń LLMPorównywanie efektywności silników serwowania i sprzętuOptymalizacja kosztu na token (tokeny/s na akcelerator)Dobór rozmiaru batcha i strategii równoległościBilansowanie kompromisu przepustowość vs latencja

Jak działa

Przepustowość mierzy się jako liczbę wygenerowanych (lub przetworzonych) tokenów podzieloną przez czas, zwykle pod zadanym obciążeniem i rozmiarem batcha. Rośnie, gdy więcej żądań jest przetwarzanych równolegle (większy batch, continuous batching) oraz gdy lepiej wykorzystany jest sprzęt (mniejszy narzut pamięci KV dzięki PagedAttention/GQA, kwantyzacja, FlashAttention). Ponieważ faza dekodowania jest ograniczona przepustowością pamięci, batching pozwala amortyzować odczyt wag między wieloma żądaniami, podnosząc przepustowość — ale kosztem wyższej latencji pojedynczego żądania. Praktyczną miarą jest 'goodput': przepustowość tylko tych żądań, które mieszczą się w celach latencyjnych (SLA).

Rozwiązany problem

Wdrożenia LLM muszą obsłużyć wiele równoczesnych żądań przy akceptowalnym koszcie. Token Throughput jako metryka pozwala mierzyć i optymalizować skalę oraz koszt na token, niezależnie od latencji pojedynczego żądania.

Kluczowe mechanizmy

Tokeny na sekundę (tok/s) na poziomie systemu i pojedynczego żądania
Goodput — przepustowość spełniająca cele SLA
Continuous batching amortyzujący odczyt wag
Równoległość (tensor / pipeline parallelism)
Efektywne KV cache (PagedAttention), GQA, kwantyzacja
Ograniczenie przepustowością pamięci i mocą obliczeniową

Mocne strony i ograniczenia

Mocne strony
✓Mierzy skalę i koszt obsługi w skali serwera
✓Bezpośrednio wiąże się z kosztem na token
✓Umożliwia planowanie pojemności i porównania systemów
✓Dopełnia latencję w pełnym obrazie wydajności
Ograniczenia
✗W kompromisie z latencją (duży batch = wyższa latencja)
✗Sama przepustowość ignoruje SLA — lepszy jest 'goodput'
✗Silnie zależna od obciążenia, długości sekwencji i sprzętu
✗Ograniczona przepustowością pamięci przy dekodowaniu
✗Trudna do utrzymania przy zmiennym, skokowym ruchu

Komponenty

Przepustowość systemowaSkala serwowania

Łączna liczba tokenów/s dla wszystkich równoczesnych żądań serwera.

Przepustowość na żądanieDoświadczenie użytkownika

Tokeny/s dostarczane pojedynczemu użytkownikowi (odwrotność TPOT).

GoodputPrzepustowość użyteczna

Przepustowość liczona tylko dla żądań spełniających cele SLA (np. limity latencji).

Oficjalna

Implementacja

Pułapki implementacyjne
Maksymalizacja przepustowości kosztem latencjiWysoka

Bardzo duży batch podnosi tokeny/s, ale psuje responsywność pojedynczego żądania.

Rozwiązanie:Optymalizuj 'goodput' pod SLA; continuous batching, priorytety, autoscaling.
Raportowanie przepustowości bez SLAŚrednia

Wysoka surowa przepustowość może obejmować żądania łamiące limity latencji.

Rozwiązanie:Raportuj goodput oraz rozkład latencji (p95/p99) razem z tok/s.
Benchmark bez realnego obciążeniaŚrednia

Pomiary przy stałej, idealnej długości sekwencji zawyżają przepustowość względem produkcji.

Rozwiązanie:Testuj na reprezentatywnych rozkładach długości i zmiennym ruchu.

Ewolucja

2022
Przepustowość jako kluczowa metryka serwowania LLM

Produkcyjne serwowanie LLM stawia tokeny/s obok latencji jako główną metrykę wydajności i kosztu.

2023
Continuous batching / PagedAttention (vLLM)
Punkt przełomowy

Radykalny wzrost przepustowości serwowania dzięki efektywnemu zarządzaniu KV cache i ciągłemu batchowaniu.

2024
Goodput i rozdzielenie prefill/decode

Optymalizacja przepustowości pod cele SLA (goodput) oraz oddzielne zasoby dla faz prefill i decode.

Hiperparametry (konfigurowalne osie)

Rozmiar batchaKrytyczna

Główny czynnik przepustowości; większy batch = wyższa przepustowość, wyższa latencja.

large / continuousMaksymalizacja przepustowości (continuous batching).
smallNiższa przepustowość, lepsza latencja.
RównoległośćWysoka

Tensor/pipeline parallelism i liczba akceleratorów zwiększające przepustowość.

tensor / pipelineRozłożenie modelu na wiele GPU.
Precyzja / kwantyzacjaWysoka

Niższa precyzja zwiększa przepustowość i zmniejsza zużycie pamięci.

FP8/INT8/INT4Więcej tokenów/s kosztem jakości.

Złożoność obliczeniowa

Złożoność czasowa: TP ≈ (batch × tokeny) / czas.

Wymagania sprzętowe

Podstawowe

Przepustowość ograniczona przepustowością pamięci (HBM) i mocą Tensor Cores; batching amortyzuje odczyt wag.

Dobry fit

Akceleratory o dużej przepustowości pamięci osiągają wysoką przepustowość tokenów.