Wysokowydajny, otwartoźródłowy (Apache 2.0) framework do serwowania modeli LLM i multimodalnych; słynie z RadixAttention i zero-overhead schedulera. Hostowany przez LMSYS.
SGLang to wysokowydajny framework do serwowania dużych modeli językowych i modeli multimodalnych, zaprojektowany pod niskie opóźnienia i wysoką przepustowość inferencji na różnych konfiguracjach sprzętowych — od pojedynczego GPU po duże klastry rozproszone. Udostępniony na licencji Apache 2.0, hostowany przez LMSYS (organizację non-profit open source), z wkładem m.in. NVIDIA, AMD, Intela i xAI.
Do kluczowych funkcji należą: RadixAttention (prefix caching), zero-overhead scheduler po stronie CPU, prefill-decode disaggregation i speculative decoding, continuous batching z paged attention, równoległość tensorowa, potokowa, ekspertów i danych, wyjścia strukturalne, chunked prefill, wiele formatów kwantyzacji (FP4/FP8/INT4/AWQ/GPTQ) oraz batchowanie multi-LoRA.
SGLang jest wdrażany na skalę ponad 400 000 GPU globalnie, wykorzystywany m.in. przez Google Cloud, Microsoft Azure, AWS, Alibabę i Tencent oraz wiodące ośrodki badawcze (Stanford, MIT, UC Berkeley).