Robocikowo>ROBOCIKOWO
Wnioskowanie

Inference Latency

2023AktywnyAktualizacja: 14 sierpnia 2026Opublikowany
Metryka wydajności: czas, jaki model AI potrzebuje na wygenerowanie odpowiedzi. Dla LLM rozkłada się na TTFT, czas na token (TPOT/ITL) i latencję end-to-end.
Kluczowa innowacja
Rozkłada opóźnienie odpowiedzi modelu na mierzalne składniki (TTFT, TPOT/ITL, latencja end-to-end), co pozwala celowo optymalizować doświadczenie użytkownika osobno od przepustowości.
Kategoria
Wnioskowanie
Poziom abstrakcji
Primitive
Poziom operacji
InferencjaUdostępnianie
Zastosowania
Definiowanie SLA i celów responsywności produktów LLMPorównywanie modeli i dostawców (benchmarki latencji)Dobór technik optymalizacji serwowaniaProjektowanie interaktywnych i głosowych asystentówBilansowanie kompromisu latencja vs przepustowość vs koszt

Jak działa

Latencję mierzy się na osi czasu pojedynczego żądania: od wysłania promptu do pierwszego tokenu (TTFT), następnie odstępy między kolejnymi tokenami (ITL) i moment ostatniego tokenu (latencja end-to-end). TTFT zależy głównie od fazy prefill (długość promptu, moc obliczeniowa), a TPOT od fazy dekodowania (ograniczonej przepustowością pamięci: odczyt wag i KV cache przy każdym kroku). Optymalizacja polega na skracaniu tych składników: mniejszy/kwantyzowany model, GQA i mniejszy KV cache, FlashAttention, dekodowanie spekulatywne, lepszy sprzęt (HBM), rozdzielenie prefill/decode oraz dobór rozmiaru batcha pod cel latencyjny.

Rozwiązany problem

Wolne odpowiedzi psują doświadczenie użytkownika i ograniczają zastosowania interaktywne oraz agentowe. Inference Latency jako metryka pozwala precyzyjnie zmierzyć i optymalizować responsywność (TTFT, TPOT) niezależnie od przepustowości.

Kluczowe mechanizmy

TTFT (Time To First Token) — czas do pierwszego tokenu
TPOT / ITL (Time Per Output Token / Inter-Token Latency)
Latencja end-to-end ≈ TTFT + liczba_tokenów × TPOT
Zależność od przepustowości pamięci (faza dekodowania)
Kompromis z przepustowością (rozmiar batcha)
Wpływ długości kontekstu, rozmiaru modelu i sprzętu

Mocne strony i ograniczenia

Mocne strony
✓Bezpośrednio mierzy responsywność odczuwaną przez użytkownika
✓Rozkład na składniki (TTFT/TPOT) wskazuje, co optymalizować
✓Umożliwia definiowanie SLA i porównania między systemami
✓Uzupełnia przepustowość i koszt w pełnym obrazie wydajności
Ograniczenia
✗Często w konflikcie z przepustowością i kosztem (kompromis)
✗Zależna od kontekstu pomiaru (długość promptu/odpowiedzi, obciążenie)
✗Zmienność (ogon rozkładu, p99) trudniejsza niż średnia
✗Rośnie z długim kontekstem i modelami rozumującymi
✗Trudna do utrzymania pod dużym, zmiennym ruchem

Komponenty

TTFT (Time To First Token)Latencja startowa

Czas od wysłania promptu do pierwszego wygenerowanego tokenu; zdominowany przez fazę prefill.

TPOT / ITLLatencja strumienia

Średni czas generowania każdego kolejnego tokenu w fazie dekodowania.

Latencja end-to-endLatencja całkowita

Całkowity czas do ukończenia odpowiedzi (≈ TTFT + liczba_tokenów × TPOT).

Implementacja

Pułapki implementacyjne
Raportowanie tylko średniej zamiast ogona (p99)Średnia

Średnia latencja ukrywa złe doświadczenia; liczy się ogon rozkładu (p95/p99).

Rozwiązanie:Mierz percentyle (p50/p95/p99) pod realnym obciążeniem.
Mylenie latencji z przepustowościąŚrednia

Optymalizacja przepustowości (duży batch) może pogorszyć latencję użytkownika.

Rozwiązanie:Osobne cele dla latencji i przepustowości; continuous batching, priorytety.
Pomiar bez realnych warunkówNiska

Pomiary bez zmiennego ruchu, długości kontekstu i sieci nie oddają produkcji.

Rozwiązanie:Benchmarki na reprezentatywnych obciążeniach i długościach.

Ewolucja

2022
Latencja jako kluczowa metryka serwowania LLM

Wraz z produkcyjnym użyciem LLM latencja staje się metryką pierwszorzędną obok przepustowości.

2023
Standaryzacja TTFT i TPOT/ITL
Punkt przełomowy

TTFT i czas na token stają się standardowymi metrykami porównań i SLA dla LLM.

2025
Latencja modeli rozumujących

Długie łańcuchy 'myślenia' istotnie zwiększają latencję end-to-end, wymuszając nowe kompromisy.

Hiperparametry (konfigurowalne osie)

Rozmiar batchaWysoka

Większy batch zwiększa przepustowość, ale pogarsza latencję pojedynczego żądania.

smallNiska latencja, mniejsza przepustowość.
largeWysoka przepustowość, wyższa latencja.
Rozmiar modelu / precyzjaWysoka

Mniejszy lub kwantyzowany model zmniejsza latencję kosztem jakości.

quantized (INT8/FP8)Szybsze dekodowanie, mniej pamięci.
Długość kontekstuŚrednia

Dłuższy prompt wydłuża prefill (TTFT), a rosnący KV cache — TPOT.

short vs longDługi kontekst = wyższa latencja.

Złożoność obliczeniowa

Złożoność czasowa: L ≈ TTFT + n·TPOT.

Wymagania sprzętowe

Podstawowe

Latencja dekodowania jest memory-bound — kluczowa jest wysoka przepustowość pamięci (HBM) GPU.

Dobry fit

Akceleratory o dużej przepustowości pamięci również obniżają TPOT.