Robocikowo>ROBOCIKOWO
Architektura

Scaled Dot-Product Attention

2017AktywnyOpublikowano: 28 maja 2026Aktualizacja: 28 maja 2026Opublikowany
Podstawowa operacja atencji w Transformerze: softmax(QK^T / √d_k)V.
Kluczowa innowacja
Zastąpienie addytywnego lub ogólnego scoringu szybkim iloczynem skalarnym zapytań i kluczy skalowanym przez √d_k, co stabilizuje gradienty i umożliwia wydajną wektoryzację atencji w Transformerze.
Kategoria
Architektura
Poziom abstrakcji
Building block
Poziom operacji
Element architekturyTreningInferencja
Zastosowania
TransformeryDuże modele językoweModele multimodalneVision TransformersMachine translation

Jak działa

Model projektuje wejście do trzech macierzy: Q (queries), K (keys) i V (values). Następnie liczy podobieństwa QK^T, skaluje je przez √d_k, normalizuje softmaxem wzdłuż pozycji kluczy i mnoży przez V, otrzymując ważoną sumę wartości dla każdego zapytania.

Rozwiązany problem

Pozwala liczyć atencję szybko i równolegle jako operacje macierzowe, unikając sekwencyjności RNN i kosztownego scoringu MLP.

Komponenty

QueriesIndeksują zapytania atencji.

Reprezentacje pozycji, dla których szukane są dopasowania.

KeysDostarczają punktów odniesienia dla score.

Reprezentacje pozycji, względem których mierzone jest podobieństwo.

ValuesNiosą informację przekazywaną do wyjścia.

Wartości agregowane wagami atencji.

Złożoność obliczeniowa

Złożoność czasowa: O(n² · d). Złożoność przestrzenna: O(n²).

Paradygmat wykonania

Tryb główny
Gęsty
Wzorzec aktywacji
Wszystkie ścieżki aktywne

Równoległość

Poziom równoległości
W pełni równoległy

W obrębie warstwy wszystkie pozycje mogą być przetwarzane równolegle jako operacje macierzowe.

Zakres
TreningInferencjaPomiędzy tokenamiPomiędzy urządzeniami

Wymagania sprzętowe

Podstawowe

Dominują mnożenia macierzy QK^T i AV, bardzo dobrze pasujące do GPU/Tensor Cores.