Mixed-Granularity Attention
Jak działa
W pracach używających tego określenia powtarzają się dwa wzorce. (1) Fuzja równoległa: gałąź gruboziarnista i gałąź drobnoziarnista działają jednocześnie, a ich wyjścia są łączone — np. w CFLD wielo-skalowe cechy drobnoziarniste wstrzykiwane są jako składniki bias do gruboziarnistego promptu. (2) Hierarchiczne, adaptacyjne doprecyzowanie: najpierw tania uwaga gruboziarnista (nad klastrami/blokami), a następnie uwaga drobnoziarnista na poziomie tokenów tylko tam, gdzie etap gruboziarnisty wskaże, że to istotne — np. Double-P (szacowanie top-p na poziomie klastrów → selektywna uwaga tokenowa) czy Native Sparse Attention (kompresja gruboziarnista + drobnoziarnista selekcja tokenów). Nie istnieje jeden kanoniczny algorytm krok-po-kroku, bo nie ma jednego mechanizmu — konkretne kroki zależą od pracy.
Rozwiązany problem
Pełna uwaga własna skaluje się kwadratowo z długością sekwencji, co jest kosztowne dla długiego kontekstu i wysokiej rozdzielczości. Z kolei sama uwaga gruboziarnista/globalna gubi lokalne detale. Mieszanie ziarnistości ma pogodzić te dwa cele: ograniczyć koszt dzięki poziomowi gruboziarnistemu, a precyzję zachować dzięki poziomowi drobnoziarnistemu.
Komponenty
Tani poziom uwagi nad zredukowaną reprezentacją: centroidami klastrów, tokenami poddanymi poolingowi/kompresji lub podsumowaniami regionów/globalnymi.
Oficjalna
Dokładna uwaga na poziomie pojedynczego tokenu lub łaty obrazu, odtwarzająca lokalną precyzję utraconą przez poziom gruboziarnisty.
Oficjalna
Decyduje, gdzie wydać kosztowną uwagę drobnoziarnistą (np. progowanie top-p, selekcja bloków, routing w stylu MoE). Występuje głównie w wariantach hierarchicznych/adaptacyjnych.
Oficjalna
Łączy wyjścia poziomów gruboziarnistego i drobnoziarnistego, np. przez dodanie cech drobnoziarnistych jako składników bias (CFLD) lub sumowanie wkładów selektywnej uwagi.
Oficjalna
Implementacja
Etap routingu/szacowania (który region doprecyzować) sam musi być tani; inaczej koszt selekcji niweluje oszczędności z poziomu gruboziarnistego. Double-P wprost wskazuje trudność jednoczesnej optymalizacji trafności top-p, narzutu selekcji i kosztu rzadkiej uwagi.
Naiwne gather/scatter po wybranych tokenach jest wolne bez kerneli zblokowanych. NSA jest „hardware-aligned”, a UniSparse podkreśla selekcję „GPU-friendly” na poziomie bloków.
Ewolucja
Praca CFLD (CVPR 2024) proponuje moduł hybrid-granularity attention kodujący wielo-skalowe, drobnoziarniste cechy wyglądu jako składniki bias wzbogacające gruboziarnisty prompt.
NSA formalizuje hierarchiczny wzorzec: gruboziarnista kompresja tokenów plus drobnoziarnista selekcja tokenów, zachowując świadomość kontekstu globalnego i lokalną precyzję; najbliższy ugruntowany mechanizm dla LLM.
Hiperparametry (konfigurowalne osie)
Steruje, ile uwagi drobnoziarnistej uruchomić (np. próg top-p). Występuje w wariantach adaptacyjnych jak Double-P.
Ziarnistość poziomu gruboziarnistego: wielkość bloków/klastrów oraz współczynnik poolingu/downsamplingu. Decyduje o bilansie koszt–jakość.
Ile poziomów ziarnistości jest łączonych (co najmniej dwa: gruby i drobny; prace wielo-skalowe stosują ich więcej).
Rozmiar okna dla gałęzi drobnoziarnistej/lokalnej, jeśli wykorzystuje ona uwagę w oknie przesuwnym.
Złożoność obliczeniowa
Złożoność czasowa: Zależna od wariantu: od sub-kwadratowej do O(n²·d).
Paradygmat wykonania
Tryb zależy od wariantu: fuzja równoległa jest gęsta, hierarchiczne doprecyzowanie jest rzadkie/warunkowe (uwaga drobnoziarnista tylko tam, gdzie etap gruboziarnisty ją wskaże).
W wariantach hierarchicznych etap gruboziarnisty steruje, gdzie uruchomić uwagę drobnoziarnistą. W wariantach fuzji równoległej routing może nie występować (obie gałęzie zawsze aktywne).