llama.cpp
Otwartoźródłowa biblioteka do inferencji modeli LLM w C/C++ — obsługuje format GGUF, kwantyzację całkowitoliczbową oraz uruchamianie modeli na CPU i GPU.

Opis
llama.cpp to otwartoźródłowa biblioteka do inferencji dużych modeli językowych (LLM) napisana w czystym C/C++ z minimalną liczbą zależności. Projekt stworzył Georgi Gerganov, a rozwój rozpoczął się w marcu 2023 roku. Biblioteka jest rozwijana równolegle z ogólnego przeznaczenia biblioteką tensorową GGML w ramach organizacji ggml-org.
llama.cpp wykorzystuje binarny format GGUF do przechowywania wag i metadanych modeli oraz obsługuje kwantyzację całkowitoliczbową od 1.5 do 8 bitów, co pozwala uruchamiać modele przy ograniczonej pamięci. Obsługuje wiele backendów sprzętowych — m.in. CPU (AVX/AVX2/AVX512/AMX), CUDA (NVIDIA), Metal (Apple Silicon), Vulkan, SYCL, HIP (AMD) i MUSA — a także hybrydową inferencję CPU+GPU.
Projekt udostępnia komponent llama-server z serwerem API zgodnym z OpenAI oraz wbudowanym interfejsem webowym. llama.cpp jest udostępniana na licencji MIT.