Robocikowo>ROBOCIKOWO
Architektura

Mixed-Granularity Attention

AktywnyOpublikowano: 1 października 2026Aktualizacja: 1 października 2026Opublikowany
Umbrellowy, opisowy termin dla mechanizmów uwagi łączących ziarnistość gruboziarnistą (region/global/zgrupowaną) z drobnoziarnistą (token/łata). Nie jest to pojedyncza, kanonicznie nazwana architektura — określenie pojawia się w kilku pracach o różnych znaczeniach.
Kluczowa innowacja
Liczenie uwagi na kilku poziomach ziarnistości jednocześnie — gruboziarnistym (klastry/regiony/tokeny spuchnięte lub globalne podsumowania) i drobnoziarnistym (poziom tokenu/łaty) — zamiast jednej, jednolitej ziarnistości, by pogodzić koszt obliczeniowy z zachowaniem lokalnych detali.
Kategoria
Architektura
Poziom abstrakcji
Wzorzec
Poziom operacji
Element architekturyWarstwa
Zastosowania
Rzadka/efektywna uwaga dla długiego kontekstu w LLM (coarse selekcja + drobnoziarnista uwaga)Generacja obrazu sterowana pozą (wstrzykiwanie wielo-skalowych cech drobnoziarnistych)Wielo-skalowa reprezentacja w widzeniu komputerowym (chmury punktów, re-identyfikacja osób)Redukcja kosztu uwagi przy zachowaniu lokalnej precyzji

Jak działa

W pracach używających tego określenia powtarzają się dwa wzorce. (1) Fuzja równoległa: gałąź gruboziarnista i gałąź drobnoziarnista działają jednocześnie, a ich wyjścia są łączone — np. w CFLD wielo-skalowe cechy drobnoziarniste wstrzykiwane są jako składniki bias do gruboziarnistego promptu. (2) Hierarchiczne, adaptacyjne doprecyzowanie: najpierw tania uwaga gruboziarnista (nad klastrami/blokami), a następnie uwaga drobnoziarnista na poziomie tokenów tylko tam, gdzie etap gruboziarnisty wskaże, że to istotne — np. Double-P (szacowanie top-p na poziomie klastrów → selektywna uwaga tokenowa) czy Native Sparse Attention (kompresja gruboziarnista + drobnoziarnista selekcja tokenów). Nie istnieje jeden kanoniczny algorytm krok-po-kroku, bo nie ma jednego mechanizmu — konkretne kroki zależą od pracy.

Rozwiązany problem

Pełna uwaga własna skaluje się kwadratowo z długością sekwencji, co jest kosztowne dla długiego kontekstu i wysokiej rozdzielczości. Z kolei sama uwaga gruboziarnista/globalna gubi lokalne detale. Mieszanie ziarnistości ma pogodzić te dwa cele: ograniczyć koszt dzięki poziomowi gruboziarnistemu, a precyzję zachować dzięki poziomowi drobnoziarnistemu.

Komponenty

Gałąź gruboziarnistaTanie, zgrubne uchwycenie kontekstu globalnego

Tani poziom uwagi nad zredukowaną reprezentacją: centroidami klastrów, tokenami poddanymi poolingowi/kompresji lub podsumowaniami regionów/globalnymi.

Oficjalna

Gałąź drobnoziarnistaZachowanie lokalnych detali i precyzji

Dokładna uwaga na poziomie pojedynczego tokenu lub łaty obrazu, odtwarzająca lokalną precyzję utraconą przez poziom gruboziarnisty.

Oficjalna

Router / mechanizm selekcjiAlokacja budżetu obliczeniowego między poziomy ziarnistości

Decyduje, gdzie wydać kosztowną uwagę drobnoziarnistą (np. progowanie top-p, selekcja bloków, routing w stylu MoE). Występuje głównie w wariantach hierarchicznych/adaptacyjnych.

Oficjalna

Krok fuzjiScalenie wieloziarnistych wyjść w jedną reprezentację

Łączy wyjścia poziomów gruboziarnistego i drobnoziarnistego, np. przez dodanie cech drobnoziarnistych jako składników bias (CFLD) lub sumowanie wkładów selektywnej uwagi.

Oficjalna

Implementacja

Pułapki implementacyjne
Narzut selekcji może zdominować zyskiWysoka

Etap routingu/szacowania (który region doprecyzować) sam musi być tani; inaczej koszt selekcji niweluje oszczędności z poziomu gruboziarnistego. Double-P wprost wskazuje trudność jednoczesnej optymalizacji trafności top-p, narzutu selekcji i kosztu rzadkiej uwagi.

Rozwiązanie:Stosuj tanie, zblokowane szacowanie i strukturę blokową zamiast selekcji per-token.
Dopasowanie do sprzętu jest krytyczneŚrednia

Naiwne gather/scatter po wybranych tokenach jest wolne bez kerneli zblokowanych. NSA jest „hardware-aligned”, a UniSparse podkreśla selekcję „GPU-friendly” na poziomie bloków.

Rozwiązanie:Projektuj selekcję i kernele w układzie blokowym, zgodnym z architekturą GPU.

Ewolucja

2024
CFLD wprowadza „hybrid-granularity attention” (najbliższy nazwany krewny)
Punkt przełomowy

Praca CFLD (CVPR 2024) proponuje moduł hybrid-granularity attention kodujący wielo-skalowe, drobnoziarniste cechy wyglądu jako składniki bias wzbogacające gruboziarnisty prompt.

2025
Native Sparse Attention (NSA): kanoniczna uwaga coarse-kompresja + drobnoziarnista selekcja

NSA formalizuje hierarchiczny wzorzec: gruboziarnista kompresja tokenów plus drobnoziarnista selekcja tokenów, zachowując świadomość kontekstu globalnego i lokalną precyzję; najbliższy ugruntowany mechanizm dla LLM.

Hiperparametry (konfigurowalne osie)

Próg selekcji / budżet masy uwagiWysoka

Steruje, ile uwagi drobnoziarnistej uruchomić (np. próg top-p). Występuje w wariantach adaptacyjnych jak Double-P.

Rozmiar klastra/bloku i współczynnik kompresjiWysoka

Ziarnistość poziomu gruboziarnistego: wielkość bloków/klastrów oraz współczynnik poolingu/downsamplingu. Decyduje o bilansie koszt–jakość.

Liczba poziomów ziarnistości / skalŚrednia

Ile poziomów ziarnistości jest łączonych (co najmniej dwa: gruby i drobny; prace wielo-skalowe stosują ich więcej).

Rozmiar okna lokalnegoŚrednia

Rozmiar okna dla gałęzi drobnoziarnistej/lokalnej, jeśli wykorzystuje ona uwagę w oknie przesuwnym.

Złożoność obliczeniowa

Złożoność czasowa: Zależna od wariantu: od sub-kwadratowej do O(n²·d).

Paradygmat wykonania

Tryb główny
Rzadki

Tryb zależy od wariantu: fuzja równoległa jest gęsta, hierarchiczne doprecyzowanie jest rzadkie/warunkowe (uwaga drobnoziarnista tylko tam, gdzie etap gruboziarnisty ją wskaże).

Wzorzec aktywacji
Zależne od wejścia
Tryby dodatkowe
GęstyWarunkowy
Mechanizm routingu

W wariantach hierarchicznych etap gruboziarnisty steruje, gdzie uruchomić uwagę drobnoziarnistą. W wariantach fuzji równoległej routing może nie występować (obie gałęzie zawsze aktywne).