2023AktywnyAktualizacja: 22 września 2026Opublikowany
Metoda przycinania (pruningu) LLM bez ponownego treningu: usuwa wagi o najmniejszym iloczynie |waga| × norma aktywacji wejścia, dla każdego wyjścia osobno.
Kluczowa
innowacja
Uwzględnienie normy aktywacji obok wielkości wagi jako kryterium przycinania bez retreningu.
Kategoria
Wnioskowanie
Poziom abstrakcji
Building block
Poziom operacji
Po-treningInferencja
Zastosowania
Kompresja LLMRzadkość (sparsity) wagWdrożenia na ograniczonym sprzęcie
Jak działa
Dla każdej wagi liczony jest wynik |waga| × norma aktywacji wejścia; per wyjście usuwa się wagi o najniższym wyniku, bez retreningu.
Rozwiązany problem
Klasyczny pruning po samej wielkości wag słabo działa dla LLM, a metody drugiego rzędu są kosztowne.