mlx-lm
Pakiet Pythona do uruchamiania i dostrajania LLM na Apple Silicon oparty na MLX — kwantyzacja, konwersja modeli z Hugging Face i serwer zgodny z OpenAI.

Opis
mlx-lm to pakiet języka Python do uruchamiania (inferencji) i dostrajania dużych modeli językowych (LLM) na komputerach z układami Apple Silicon. Jest rozwijany przez zespół badawczy Apple (organizacja ml-explore na GitHubie) i udostępniony na licencji MIT.
Pakiet jest zbudowany na frameworku MLX — to odrębny projekt korzystający z MLX jako warstwy obliczeniowej. Zapewnia integrację z Hugging Face Hub (pobieranie i publikacja modeli), kwantyzację i konwersję modeli, dostrajanie pełne oraz metodą LoRA (także dla modeli skwantyzowanych), a także rozproszoną inferencję i trening przez mx.distributed.
mlx-lm udostępnia interfejs wiersza poleceń (m.in. mlx_lm.generate, mlx_lm.chat, mlx_lm.convert, mlx_lm.lora) oraz API Pythona. Zawiera również serwer HTTP z endpointem zgodnym z API czatu OpenAI, co pozwala korzystać z lokalnie uruchamianych modeli w narzędziach napisanych pod OpenAI.