Robocikowo>ROBOCIKOWO
Wnioskowanie

AWQ

2023AktywnyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
AWQ (Activation-aware Weight Quantization) to metoda post-treningowej kwantyzacji LLM do niskiej precyzji (typowo 4-bit), która wybiera i skaluje najistotniejsze kanały wag na podstawie statystyk aktywacji.
Kluczowa innowacja
Kwantyzacja wag świadoma aktywacji: zamiast traktować wszystkie wagi równo, AWQ chroni ~1% najważniejszych kanałów wag (wskazanych przez rozkład aktywacji) przez skalowanie per kanał, osiągając dokładną kwantyzację 4-bit bez wstecznej propagacji.
Kategoria
Wnioskowanie
Poziom abstrakcji
Wzorzec
Poziom operacji
ModelPo-treningInferencja
Zastosowania
Kwantyzacja 4-bit LLM do lokalnej i serwerowej inferencjiWdrażanie modeli na urządzeniach brzegowych i mobilnychPrzygotowanie modeli do serwowania w vLLM / TensorRT-LLMKwantyzacja modeli multimodalnych i instruktażowych z zachowaniem jakościRedukcja VRAM przy wysokiej przepustowości inferencji

Jak działa

AWQ przepuszcza przez model mały zbiór kalibracyjny i mierzy magnitudy aktywacji na wejściu każdej warstwy liniowej. Kanały wag odpowiadające największym aktywacjom uznaje za istotne. Dla każdego kanału wyznacza współczynnik skalujący: wagę istotnego kanału mnoży się przez skalę (redukując jej relatywny błąd kwantyzacji), a odpowiadającą aktywację dzieli przez tę samą skalę, co zachowuje wynik mnożenia macierzy. Optymalną skalę dobiera się siatkowo, minimalizując błąd wyjścia warstwy. Po wyznaczeniu skal wagi kwantyzuje się grupowo do 4 bitów. Metoda nie wymaga wstecznej propagacji ani rekonstrukcji drugiego rzędu, więc jest szybka i dobrze generalizuje na różne domeny.

Rozwiązany problem

Naiwna kwantyzacja 4-bitowa traci dokładność, bo niewielki ułamek wag odpowiadających kanałom o dużej magnitudzie aktywacji jest krytyczny dla jakości modelu, a jednolita kwantyzacja psuje właśnie te kanały. AWQ rozwiązuje to, identyfikując istotne kanały z rozkładu aktywacji i skalując je tak, by ich błąd kwantyzacji był znikomy, bez potrzeby danych treningowych z etykietami ani wstecznej propagacji.

Kluczowe mechanizmy

Analiza magnitud aktywacji na zbiorze kalibracyjnym
Identyfikacja ~1% istotnych kanałów wag
Skalowanie per kanał (waga x s, aktywacja / s) zachowujące wynik
Przeszukiwanie siatki skal minimalizujące błąd wyjścia warstwy
Grupowa kwantyzacja 4-bit po ustaleniu skal

Mocne strony i ograniczenia

Mocne strony
✓Dokładna kwantyzacja 4-bit z zachowaniem jakości modelu
✓Brak wstecznej propagacji i rekonstrukcji drugiego rzędu (szybkość)
✓Dobra generalizacja na różne domeny i modele instruktażowe/multimodalne
✓Małe ryzyko przeuczenia do zbioru kalibracyjnego
✓Wsparcie zoptymalizowanych kerneli w vLLM, TensorRT-LLM, AutoAWQ
Ograniczenia
✗Wymaga reprezentatywnego zbioru kalibracyjnego dla statystyk aktywacji
✗Korzyść wydajnościowa zależy od dopasowanych kerneli INT4
✗Skupiona na kwantyzacji wag (nie aktywacji) — głównie weight-only
✗Skrajnie niskie bity (2-3) nadal trudne bez utraty jakości
✗Dobór skal siatkowo dodaje krok kalibracji przed wdrożeniem

Komponenty

Analiza istotności aktywacjiWybór istotnych kanałów do ochrony

Pomiar magnitud aktywacji na zbiorze kalibracyjnym w celu wskazania kanałów wag krytycznych dla jakości wyjścia.

Skalowanie per kanałOchrona istotnych wag przed błędem kwantyzacji

Mnożenie wag istotnego kanału przez skalę i dzielenie aktywacji przez tę samą skalę, co zmniejsza błąd kwantyzacji bez zmiany wyniku mnożenia.

Grupowa kwantyzacja 4-bitWłaściwa kompresja wag do 4 bitów

Po dobraniu skal wagi kwantyzuje się grupowo (np. grupy po 128) do całkowitych 4-bitowych wartości ze skalą per grupa.

Implementacja

Pułapki implementacyjne
Niereprezentatywny zbiór kalibracyjnyŚrednia

Identyfikacja istotnych kanałów zależy od statystyk aktywacji; zbiór kalibracyjny odbiegający od danych docelowych daje suboptymalne skale.

Rozwiązanie:Użyj kilkuset próbek reprezentatywnych dla docelowej domeny; AWQ jest odporne, ale nie na skrajnie niezgodny rozkład.
Brak dopasowanych kerneli inferencjiŚrednia

Korzyść wydajnościowa AWQ wymaga kerneli obsługujących spakowane wagi INT4; uruchomienie przez naiwną dekwantyzację niweluje przyspieszenie.

Rozwiązanie:Serwuj przez runtime ze wsparciem AWQ (vLLM, TensorRT-LLM, AutoAWQ) z natywnymi kernelami INT4.

Ewolucja

Oryginalny paper · 2023 · MLSys 2024 (Best Paper) · Ji Lin
AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration
Ji Lin, Jiaming Tang, Haotian Tang, Shang Yang, Guangxuan Xiao, Song Han
2023
Publikacja AWQ
Punkt przełomowy

Zespół MIT Han Lab przedstawia AWQ jako metodę kwantyzacji 4-bit świadomą aktywacji, bez wstecznej propagacji.

2024
AWQ zdobywa Best Paper na MLSys 2024

Metoda staje się jednym ze standardów kwantyzacji 4-bit i zostaje zintegrowana w vLLM oraz TensorRT-LLM.

Hiperparametry (konfigurowalne osie)

Liczba bitów wagKrytyczna

Docelowa precyzja skwantyzowanych wag.

4Najpopularniejsza konfiguracja.
3Bardziej agresywna, większa utrata jakości.
Rozmiar grupyWysoka

Liczba wag dzielących skalę przy kwantyzacji grupowej.

128Domyślny balans.
Liczba próbek kalibracyjnychŚrednia

Rozmiar zbioru używanego do pomiaru statystyk aktywacji.

128-512Typowy zakres.

Złożoność obliczeniowa

Charakterystyki obliczeniowe
→Kwantyzacja weight-only, typowo 4-bit grupowo
→Kalibracja na kilkuset próbkach, bez wstecznej propagacji
→Skala per kanał dla istotnych wag
→Model wynikowy ~4x mniejszy niż FP16
→Inferencja z kernelami INT4 (vLLM, TensorRT-LLM, AutoAWQ)

Złożoność czasowa: O(L x G x N_kalib) kalibracja + inferencja jak gęsty model. Złożoność przestrzenna: ~4,x bita / waga (INT4 + skale per kanał).

Uwagi do benchmarku

W pracy źródłowej (MLSys 2024, Best Paper) AWQ osiąga niższą perplexity niż round-to-nearest i konkuruje z GPTQ na modelach LLaMA/OPT przy 4-bit, przy zachowaniu jakości na zadaniach instruktażowych i multimodalnych. Proces kwantyzacji jest szybki (rzędu minut-godzin zależnie od rozmiaru), bo nie wymaga treningu ani odwracania Hesjanu.

Wąskie gardło obliczeniowe

Kalibracja aktywacji i przeszukiwanie skal

Koszt AWQ dominują przejścia zbioru kalibracyjnego przez model i przeszukiwanie siatki skal per warstwa; inferencja jest ograniczona pamięcią jak w INT4.

Zależy od
Rozmiar zbioru kalibracyjnegoGęstość siatki skal

Paradygmat wykonania

Tryb główny
Gęsty

Wszystkie kanały pozostają aktywne; różnicowane jest jedynie skalowanie wag.

Wzorzec aktywacji
Wszystkie ścieżki aktywne
Mechanizm routingu

AWQ nie wprowadza routingu; to metoda kwantyzacji wag dla gęstych obliczeń.

Równoległość

Poziom równoległości
Częściowo równoległy

Kalibracja przebiega warstwa po warstwie (statystyki aktywacji), ale w obrębie warstwy jest równoległa; inferencja w pełni równoległa.

Zakres
InferencjaPomiędzy warstwami

Wymagania sprzętowe

Podstawowe

Modele AWQ działają z zoptymalizowanymi kernelami INT4 (np. w vLLM, TensorRT-LLM, AutoAWQ) na GPU NVIDIA, łącząc małą pamięć z wysoką przepustowością.

Możliwe

Wagi AWQ można eksportować do formatów uruchamialnych na CPU, choć szczytową wydajność osiąga się na GPU.