Prompt jest tokenizowany i przetwarzany w fazie prefill: model liczy reprezentacje wszystkich tokenów naraz i zapisuje pary klucz-wartość dla warstw uwagi (KV cache). Następnie w fazie decode model, korzystając z KV cache, generuje kolejne tokeny jeden po drugim; każdy nowy token dopisuje swoje wpisy do KV cache. Serwer inferencyjny grupuje żądania (batching), zarządza pamięcią KV (np. PagedAttention), stosuje parametry próbkowania (temperatura, top-p) i może używać technik przyspieszających (dekodowanie spekulatywne, kwantyzacja, FlashAttention). Generacja kończy się po osiągnięciu tokenu stopu lub limitu długości.
Uruchamianie LLM do generowania tekstu jest kosztowne i wolne, bo autoregresyjne dekodowanie jest sekwencyjne i ograniczone przepustowością pamięci. LLM Inference jako dziedzina rozwiązuje problem, jak generować tokeny szybko, tanio i przy wysokiej przepustowości bez zmiany wag modelu.
Równoległe przetwarzanie całego promptu i zapełnienie KV cache; zwykle compute-bound.
Autoregresyjna generacja token po tokenie z użyciem KV cache; zwykle memory-bound.
Pamięć podręczna par klucz-wartość warstw uwagi, unikająca ponownego liczenia dla wcześniejszych tokenów.
Oficjalna
Warstwa serwera grupująca żądania i zarządzająca pamięcią (np. continuous batching, PagedAttention).
Oficjalna
Długi kontekst i duży batch szybko wyczerpują pamięć GPU przez rosnący KV cache.
Duże batch zwiększają przepustowość, ale pogarszają latencję pojedynczego żądania i odwrotnie.
Zbyt niska precyzja (np. INT4) może pogorszyć jakość generacji.
Architektura, na której opiera się generacja tekstu token po tokenie i KV cache.
Przyspieszenie uwagi kluczowe dla prefill i długiego kontekstu.
Efektywne zarządzanie KV cache i ciągłe batchowanie radykalnie zwiększyły przepustowość serwowania.
Model szkicujący przyspiesza generację bez utraty jakości.
Oddzielne zasoby dla faz prefill i decode optymalizują koszt i latencję w dużych wdrożeniach.
Złożoność czasowa: O(n·d² + n²·d). Złożoność przestrzenna: O(P + L·n·d).
Sposób grupowania żądań; kompromis latencja vs przepustowość.
Format liczbowy wag/aktywacji wpływający na szybkość, pamięć i jakość.
Temperatura, top-p, top-k sterujące losowością generacji.
Dla modeli gęstych wszystkie wagi aktywne na token; modele MoE aktywują podzbiór ekspertów (mixture).
Prefill jest silnie równoległy po tokenach; decode jest sekwencyjny po tokenach, ale równoległy po żądaniach (batch) i urządzeniach (tensor/pipeline parallelism).
Inferencja LLM to intensywne mnożenia macierzy; kluczowa jest też przepustowość pamięci (HBM).
Modele serwowane także na TPU i innych akceleratorach.
Możliwe (np. llama.cpp) dla małych modeli, ale wolniejsze.