Robocikowo>ROBOCIKOWO
Architektura

Attention Head

2017AktywnyOpublikowano: 24 sierpnia 2026Aktualizacja: 24 sierpnia 2026Opublikowany
Pojedyncza głowica uwagi to niezależna jednostka mechanizmu atencji z własnymi projekcjami zapytań, kluczy i wartości, ucząca się jednego wzorca relacji między tokenami.
Kluczowa innowacja
Wyodrębnienie pojedynczej głowicy uwagi jako niezależnej jednostki obliczeniowej z własnymi projekcjami Q/K/V, dzięki czemu wiele głowic może równolegle uczyć się różnych wzorców relacji między tokenami w odrębnych podprzestrzeniach reprezentacji.
Kategoria
Architektura
Poziom abstrakcji
Building block
Poziom operacji
Element architekturyWarstwa
Zastosowania
Modele językowe (LLM)Tłumaczenie maszynoweTransformery wizyjne (ViT)Rozpoznawanie mowyInterpretowalność mechanistycznaAnaliza i przycinanie głowic (head pruning)

Jak działa

1) Wejściowe reprezentacje tokenów X są rzutowane trzema uczonymi macierzami głowicy: Q = XW^Q, K = XW^K, V = XW^V, każda do wymiaru d_k. 2) Głowica oblicza surowe wyniki podobieństwa QK^T i skaluje je przez 1/√d_k, aby ustabilizować gradienty softmax. 3) Opcjonalna maska (np. przyczynowa w dekoderze) zeruje niedozwolone pozycje. 4) softmax wierszami tworzy wzorzec uwagi — rozkład wag sumujący się do 1. 5) Wagi mnożą wektory wartości V, dając wyjście głowicy (ważona suma wartości). 6) Wyjścia wszystkich h głowic są konkatenowane i rzutowane przez W^O do wymiaru d_model, po czym trafiają do strumienia rezydualnego.

Rozwiązany problem

Pojedynczy mechanizm uwagi uśrednia informacje w jednej podprzestrzeni reprezentacji, co ogranicza jego zdolność do jednoczesnego modelowania wielu różnych typów zależności między tokenami. Rozbicie uwagi na wiele niezależnych głowic pozwala każdej z nich skupić się na innym wzorcu relacji (np. sąsiedztwo pozycyjne, zależności składniowe, koreferencja) bez wzajemnego zakłócania.

Komponenty

Projekcje Q/K/VDefiniują podprzestrzeń, w której głowica mierzy podobieństwo i agreguje informację.

Trzy uczone macierze W^Q, W^K, W^V rzutujące reprezentacje tokenów do podprzestrzeni głowicy o wymiarze d_k.

INReprezentacje tokenów ze strumienia rezydualnego.
OUTWektory Q, K, V dla każdej pozycji.

Oficjalna

Scaled dot-product attentionOblicza, które tokeny i w jakim stopniu wpływają na reprezentację każdej pozycji.

Rdzeń głowicy: softmax(QK^T/√d_k)V, wytwarzający wzorzec uwagi i ważoną sumę wartości.

INRzutowane wektory zapytań, kluczy i wartości.
OUTWyjście głowicy przed konkatenacją.

Oficjalna

Attention patternReprezentuje, które pozycje uwzględnia głowica; podstawa analizy interpretowalności.

Macierz wag uwagi T×T (po softmax), interpretowana w mechanistycznej analizie jako obwód QK.

INSkalowane wyniki podobieństwa.
OUTRozkład wag sumujący się do 1 w każdym wierszu.

Implementacja

Pułapki implementacyjne
Brak skalowania 1/√d_kWysoka

Pominięcie skalowania powoduje duże iloczyny skalarne, które wpychają softmax w obszary o znikającym gradiencie.

Rozwiązanie:Zawsze dziel QK^T przez √d_k przed softmax.
Błędne maskowanie przyczynoweKrytyczna

Nieprawidłowa maska pozwala głowicy zaglądać do przyszłych tokenów, powodując wyciek informacji w treningu autoregresyjnym.

Rozwiązanie:Stosuj dolnotrójkątną maskę i weryfikuj ją testami jednostkowymi.
d_model niepodzielne przez hŚrednia

Gdy d_model nie dzieli się przez liczbę głowic, wymiar głowicy jest niecałkowity i kształt tensora się nie zgadza.

Rozwiązanie:Dobieraj h tak, by d_model % h == 0.

Ewolucja

Oryginalny paper · 2017 · NeurIPS 2017 · Ashish Vaswani
Attention Is All You Need
Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Lukasz Kaiser, Illia Polosukhin
2017
Transformer wprowadza wielogłowicową uwagę
Punkt przełomowy

Głowica uwagi zdefiniowana jako niezależna jednostka z własnymi projekcjami Q/K/V (h=8, d_k=64).

2019
Redundancja i przycinanie głowic

Michel i in. pokazują, że wiele głowic można usunąć w czasie inferencji bez istotnej utraty jakości.

2021
Rozkład głowicy na obwody QK i OV
Punkt przełomowy

Framework Transformer Circuits opisuje głowicę jako niezależną, addytywną operację — podstawa interpretowalności mechanistycznej.

2022
Induction heads i uczenie w kontekście
Punkt przełomowy

Olsson i in. identyfikują wyspecjalizowane głowice (prefix matching + copying) powiązane z pojawieniem się uczenia w kontekście.

Hiperparametry (konfigurowalne osie)

Wymiar głowicy (d_k)Krytyczna

Wymiar podprzestrzeni Q/K/V pojedynczej głowicy; zwykle d_model/h (np. 64).

64Transformer base (d_model=512, h=8).
128Częste w większych LLM.
Liczba głowic (h)Wysoka

Liczba równoległych głowic w warstwie uwagi; określa liczbę niezależnych podprzestrzeni.

8Transformer base.
96GPT-3 175B.
Typ maskowaniaWysoka

Przyczynowe (dekoder, autoregresja) vs dwukierunkowe (enkoder).

Złożoność obliczeniowa

Złożoność czasowa: O(n² · d_k). Złożoność przestrzenna: O(n² + n · d_k).

Wąskie gardło obliczeniowe

Kwadratowa macierz uwagi QK^T

Obliczenie i softmax macierzy T×T rośnie kwadratowo z długością sekwencji, co jest głównym ograniczeniem przy długim kontekście.

Paradygmat wykonania

Tryb główny
Gęsty

Standardowa głowica jest gęsta — wszystkie pary pozycji są oceniane (przed ewentualnym maskowaniem).

Wzorzec aktywacji
Wszystkie ścieżki aktywne
Mechanizm routingu

Równoległość

Poziom równoległości
W pełni równoległy

Głowice są od siebie niezależne i liczone równolegle; w treningu również wszystkie pozycje naraz. Autoregresyjna generacja jest sekwencyjna po tokenach.

Zakres
TreningInferencjaPomiędzy tokenami

Wymagania sprzętowe

Podstawowe

Operacje QK^T i (softmax)·V to gęste mnożenia macierzy, idealne dla rdzeni tensorowych.

Dobry fit

Jednostki macierzowe TPU dobrze obsługują atencję opartą na matmul.