Robocikowo>ROBOCIKOWO
Wnioskowanie

GPTQ

2022AktywnyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
GPTQ to jednorazowa, post-treningowa metoda kwantyzacji wag LLM oparta na aproksymacji Hesjanu (OBQ/OBS), pozwalająca na dokładną kwantyzację do 4 lub 3 bitów bez ponownego treningu.
Kluczowa innowacja
Post-treningowa kwantyzacja oparta na informacji drugiego rzędu (przybliżenie Hesjanu), która kwantyzuje wagi warstwa po warstwie, kolumna po kolumnie, korygując pozostałe wagi po każdym kroku, aby zminimalizować błąd rekonstrukcji wyjścia warstwy — umożliwia dokładny 4- i 3-bit dla modeli 100B+ w kilka godzin na jednym GPU.
Kategoria
Wnioskowanie
Poziom abstrakcji
Wzorzec
Poziom operacji
ModelPo-treningInferencja
Zastosowania
Kwantyzacja 4-bit i 3-bit bardzo dużych LLM do inferencjiPrzygotowanie modeli do serwowania w vLLM / TGI / TensorRT-LLMRedukcja VRAM przy zachowaniu jakości generacjiKwantyzacja modeli open-weight do dystrybucji (np. formaty GPTQ na Hugging Face)Inferencja LLM na pojedynczym konsumenckim GPU

Jak działa

GPTQ kwantyzuje każdą warstwę liniową niezależnie, minimalizując błąd rekonstrukcji jej wyjścia na zbiorze kalibracyjnym. Dla danej warstwy oblicza się macierz Hesjanu H = 2 X X^T z aktywacji wejściowych. Wagi kwantyzuje się kolumnami: po skwantyzowaniu kolejnej kolumny pozostałe, jeszcze nieskwantyzowane wagi aktualizuje się (kompensacja błędu) zgodnie z regułą wywodzącą się z Optimal Brain Surgeon, korzystając z odwrotności Hesjanu. GPTQ przetwarza kolumny w ustalonej kolejności i stosuje aktualizacje blokowe oraz stabilizację numeryczną (Cholesky), co pozwala skwantyzować modele z miliardami parametrów w kilka godzin na jednym GPU. Wynik zapisuje się jako wagi 4- lub 3-bitowe ze skalą per grupa.

Rozwiązany problem

Kwantyzacja wag do 4 lub 3 bitów metodą zaokrąglania (round-to-nearest) mocno psuje jakość bardzo dużych modeli, a metody wymagające ponownego treningu są zbyt kosztowne dla modeli rzędu setek miliardów parametrów. GPTQ rozwiązuje to jako szybka, jednorazowa procedura, która korzysta z informacji o krzywiźnie funkcji straty (Hesjan wejść warstwy), by kwantyzować wagi z minimalnym wzrostem błędu wyjścia.

Kluczowe mechanizmy

Aproksymacja Hesjanu H = 2 X X^T z aktywacji warstwy
Kwantyzacja kolumnowa z kompensacją błędu (reguła OBS)
Aktualizacje blokowe i ustalona kolejność kolumn
Stabilizacja numeryczna: Cholesky i tłumienie przekątnej
Zapis wag jako 4-/3-bit ze skalą per grupa

Mocne strony i ograniczenia

Mocne strony
✓Dokładna kwantyzacja 4- i 3-bit dzięki informacji drugiego rzędu
✓Jednorazowa procedura bez ponownego treningu
✓Skaluje się do modeli 100B+ w kilka godzin na jednym GPU
✓Szeroki ekosystem (AutoGPTQ/GPTQModel, Hugging Face, vLLM, TGI)
✓Formaty GPTQ jako standard dystrybucji skwantyzowanych modeli
Ograniczenia
✗Niestabilność numeryczna źle uwarunkowanego Hesjanu
✗Ryzyko przeuczenia do małego zbioru kalibracyjnego
✗Kwantyzacja per warstwa (lokalny cel), nie globalny błąd end-to-end
✗Wymaga przejściowej pamięci na Hesjan warstwy podczas kwantyzacji
✗Korzyść wydajnościowa zależy od dopasowanych kerneli INT4

Komponenty

Aproksymacja Hesjanu warstwyŹródło informacji drugiego rzędu do kompensacji błędu

Macierz H = 2 X X^T z aktywacji wejściowych warstwy, opisująca wrażliwość wyjścia na perturbacje poszczególnych wag.

Kwantyzacja kolumnowa z kompensacjąMinimalizacja błędu rekonstrukcji wyjścia warstwy

Kwantyzacja wag kolumna po kolumnie, po której pozostałe wagi są korygowane wg reguły OBS, aby zredukować skumulowany błąd.

Stabilizacja numeryczna (Cholesky)Stabilność i skalowalność procedury

Rozkład Cholesky odwrotności Hesjanu i aktualizacje blokowe zapewniające stabilność i wydajność przy dużych warstwach.

Implementacja

Pułapki implementacyjne
Niestabilność numeryczna HesjanuŚrednia

Odwracanie macierzy Hesjanu bywa niestabilne, gdy jest źle uwarunkowana, co psuje kompensację błędu.

Rozwiązanie:Dodaj tłumienie (dampening) do przekątnej Hesjanu i użyj rozkładu Cholesky do stabilnego rozwiązania.
Przeuczenie do zbioru kalibracyjnegoŚrednia

Minimalizacja błędu rekonstrukcji na małym, niereprezentatywnym zbiorze kalibracyjnym może pogorszyć generalizację modelu.

Rozwiązanie:Użyj wystarczająco dużego i zróżnicowanego zbioru kalibracyjnego zbliżonego do danych docelowych.

Ewolucja

Oryginalny paper · 2022 · ICLR 2023 · Elias Frantar
GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers
Elias Frantar, Saleh Ashkboos, Torsten Hoefler, Dan Alistarh
2022
OBQ / GPTQ formalizuje kwantyzację opartą na Hesjanie
Punkt przełomowy

GPTQ rozwija metodę Optimal Brain Quantization do skali LLM, umożliwiając dokładny 4- i 3-bit dla modeli 100B+.

2023
Formaty GPTQ stają się standardem dystrybucji modeli

AutoGPTQ i integracja z Hugging Face / Transformers czynią GPTQ jednym z najpopularniejszych formatów skwantyzowanych LLM.

Hiperparametry (konfigurowalne osie)

Liczba bitówKrytyczna

Docelowa precyzja wag (3 lub 4 bity).

4Standard o niskiej utracie jakości.
3Agresywniejsza, większa utrata.
Rozmiar grupyWysoka

Liczba wag dzielących skalę.

128Typowy balans.
Kolejnosc wg aktywacji (act-order)Średnia

Kwantyzacja kolumn w kolejności wg ważności aktywacji, poprawiająca dokładność.

trueLepsza dokładność, wolniejsze kernele.
Tłumienie HesjanuŚrednia

Wartość dodawana do przekątnej Hesjanu dla stabilności numerycznej.

0.01Typowa wartość tłumienia.

Złożoność obliczeniowa

Charakterystyki obliczeniowe
→Kwantyzacja weight-only, typowo 4- lub 3-bit grupowo
→Wykorzystuje informację drugiego rzędu (Hesjan)
→Kalibracja na kilkuset próbkach, bez wstecznej propagacji
→Przejściowa pamięć na Hesjan i jego odwrotność per warstwa
→Inferencja z kernelami INT4 (ExLlama, Marlin)

Złożoność czasowa: O(d^3) na warstwę (odwracanie Hesjanu) + O(N_kalib x d^2). Złożoność przestrzenna: O(d^2) przejściowo na Hesjan + ~4,x bita / waga wynikowo.

Uwagi do benchmarku

W pracy źródłowej (ICLR 2023) GPTQ skwantyzował modele OPT-175B i BLOOM-176B do 3-4 bitów w około 4 godziny na jednym GPU A100, z niewielkim wzrostem perplexity względem FP16. Dla większych modeli utrata jakości przy 4-bit jest zwykle marginalna, a przy 3-bit zauważalna, lecz akceptowalna w wielu zastosowaniach.

Wąskie gardło obliczeniowe

Operacje na Hesjanie warstwy

Podczas kwantyzacji wąskim gardłem jest obliczenie i odwrócenie Hesjanu oraz sekwencyjna kompensacja błędu; w inferencji, jak w INT4, dominuje odczyt pamięci.

Zależy od
Szerokość warstwy dUwarunkowanie Hesjanu

Paradygmat wykonania

Tryb główny
Gęsty

Wszystkie ścieżki obliczeń pozostają aktywne; kwantyzowana jest reprezentacja wag.

Wzorzec aktywacji
Wszystkie ścieżki aktywne
Mechanizm routingu

GPTQ nie wprowadza routingu; to metoda kwantyzacji wag dla gęstych obliczeń.

Równoległość

Poziom równoległości
Sekwencyjny

Kwantyzacja kolumn jest z natury sekwencyjna (kompensacja błędu zależy od poprzednich kolumn); warstwy można przetwarzać niezależnie, inferencja jest w pełni równoległa.

Zakres
InferencjaPomiędzy warstwami

Wymagania sprzętowe

Podstawowe

Modele GPTQ działają z kernelami INT4 (ExLlama, Marlin, w vLLM / TGI / TensorRT-LLM) na GPU NVIDIA, łącząc małą pamięć z wysoką przepustowością.

Możliwe

Wagi GPTQ można konwertować do formatów uruchamialnych na CPU, choć metoda i kernele celują głównie w GPU.