GGML
Biblioteka tensorowa w czystym C/C++ do uczenia maszynowego, umożliwiająca wydajną inferencję dużych modeli na powszechnym sprzęcie (CPU/GPU); fundament llama.cpp i whisper.cpp.

Opis
GGML to biblioteka tensorowa do uczenia maszynowego napisana w czystym C/C++, bez zależności zewnętrznych. Została stworzona przez Georgiego Gerganova (start prac we wrześniu 2022 r.) i rozwijana jest w organizacji ggml-org. Zaprojektowano ją tak, aby umożliwiać uruchamianie dużych modeli z wysoką wydajnością na powszechnie dostępnym sprzęcie.
Kluczowe cechy to kwantyzacja całkowitoliczbowa od 2 do 8 bitów oraz formaty mikroskalowania MXFP4 i NVFP4, zerowe alokacje pamięci w czasie działania, jądra zoptymalizowane pod SIMD (x86, ARM, RISC-V) oraz szerokie wsparcie backendów obliczeniowych: CPU, GPU (CUDA, Metal, Vulkan), NPU i przeglądarka (WebAssembly). Biblioteka jest wieloplatformowa (x86, ARM, RISC-V, LoongArch, PowerPC, s390x, WASM).
GGML stanowi fundament obliczeniowy projektów llama.cpp i whisper.cpp. Modele przechowywane są w binarnym formacie GGUF (GGML Universal File, wprowadzony w sierpniu 2023 r.), który zastąpił wcześniejszy format GGML. Całość udostępniana jest na licencji MIT.