Szybka, otwartoźródłowa (Apache 2.0) biblioteka i serwer do inferencji oraz serwowania modeli LLM; słynie z PagedAttention i continuous batching.

vLLM to szybka i łatwa w użyciu, otwartoźródłowa biblioteka do inferencji oraz serwowania dużych modeli językowych, udostępniona na licencji Apache 2.0. Powstała w Sky Computing Lab na UC Berkeley, a obecnie jest rozwijana przez społeczność liczącą ponad 2000 kontrybutorów z uczelni i firm na całym świecie (od 2025 jako projekt hostowany przez PyTorch Foundation).
Kluczową innowacją jest PagedAttention — efektywne zarządzanie pamięcią dla danych klucz-wartość mechanizmu uwagi. vLLM stosuje continuous batching z chunked prefill i prefix caching, udostępnia serwer API zgodny z OpenAI (oraz Anthropic Messages API i gRPC), obsługuje kwantyzację (FP8, MXFP8/MXFP4, NVFP4, INT8, INT4, GPTQ/AWQ, GGUF, compressed-tensors) i inferencję rozproszoną (równoległość tensorowa, potokowa, danych, ekspertów i kontekstu).
Obsługuje szeroki wachlarz sprzętu: układy GPU NVIDIA i AMD, procesory x86/ARM/PowerPC oraz wyspecjalizowane akceleratory.