Robocikowo>ROBOCIKOWO
Architektura

QK-Norm

2020AktywnyOpublikowano: 24 sierpnia 2026Aktualizacja: 24 sierpnia 2026Opublikowany
Technika normalizacji uwagi: Q i K są normalizowane (L2/LayerNorm/RMSNorm) przed iloczynem skalarnym, co stabilizuje logity uwagi i zapobiega saturacji softmaxa.
Kluczowa innowacja
Normalizuje wektory zapytań (Q) i kluczy (K) przed iloczynem skalarnym uwagi i zastępuje stałe skalowanie 1/√d uczonym parametrem, dzięki czemu logity uwagi nie rozbiegają się, a softmax nie ulega saturacji.
Kategoria
Architektura
Poziom abstrakcji
Building block
Poziom operacji
Element architekturyWarstwaTrening
Zastosowania
Stabilizacja treningu dużych transformerówTłumaczenie maszynowe niskozasoboweSkalowanie Vision TransformerówDuże modele językowe (LLM)Zapobieganie saturacji softmaxa uwagi

Jak działa

1) Po projekcjach liniowych na Q i K, każdy wektor zapytania i klucza jest normalizowany wzdłuż wymiaru głowicy (head_dim). W oryginale jest to normalizacja L2; w wariantach stosuje się LayerNorm (ViT-22B) lub RMSNorm (Qwen3). 2) Znormalizowane Q i K są mnożone (iloczyn skalarny). Po normalizacji L2 iloczyn jest ograniczony do [-1, 1]. 3) Zamiast dzielenia przez √d wynik jest skalowany uczonym parametrem (temperatura g), który kontroluje ostrość rozkładu softmax. 4) Reszta uwagi (softmax, mnożenie przez V) pozostaje bez zmian.

Rozwiązany problem

Bez normalizacji logity uwagi (iloczyny Q·K) mogą rosnąć do bardzo dużych wartości przy skalowaniu modelu, co prowadzi do saturacji softmaxa: rozkład uwagi staje się niemal one-hot o zerowej entropii, gradienty zanikają, a trening dużych modeli rozbiega się. QK-Norm ogranicza zakres logitów i stabilizuje trening.

Komponenty

Normalizacja Q/KOgraniczenie zakresu logitów uwagi

Krok normalizujący wektory zapytań i kluczy wzdłuż wymiaru głowicy przed iloczynem skalarnym.

INWektory Q i K po projekcji liniowej.
OUTZnormalizowane Q i K.
L2 normalizationOryginalny QKNorm (Henry i in. 2020): normalizacja L2 wzdłuż wymiaru głowicy.
QK LayerNormWariant z ViT-22B: LayerNorm na Q i K.
QK RMSNormWariant z Qwen3: RMSNorm na Q i K.

Oficjalna

Uczony parametr skalujący (temperatura g)Kontrola ostrości softmaxa

Parametr uczony zastępujący stałe skalowanie 1/√d; kontroluje ostrość rozkładu softmax po znormalizowanym iloczynie Q·K.

Implementacja

Pułapki implementacyjne
Pominięcie uczonej skaliWysoka

Po normalizacji L2 iloczyn Q·K jest ograniczony do [-1,1]; bez uczonego parametru g logity są zbyt małe, a softmax zbyt płaski.

Rozwiązanie:Zawsze dodać uczony parametr skalujący (temperaturę) zamiast 1/√d.
Zła oś lub typ normalizacjiŚrednia

Normalizacja musi być per-głowica wzdłuż head_dim; wybór wariantu (L2 vs LayerNorm vs RMSNorm) wpływa na stabilność.

Rozwiązanie:Normalizować wzdłuż head_dim i dobrać wariant zgodnie z architekturą referencyjną.
Kolejność względem RoPEŚrednia

QK-Norm i rotacyjne kodowanie pozycji (RoPE) działają na tych samych Q/K; kolejność ich stosowania wpływa na wynik.

Rozwiązanie:Ustalić i konsekwentnie stosować kolejność (normalizacja vs RoPE) zgodną z implementacją referencyjną.

Ewolucja

Oryginalny paper · 2020 · Findings of EMNLP 2020 · Alex Henry
Query-Key Normalization for Transformers
Alex Henry, Prudhvi Raj Dachapally, Shubham Pawar, Yuxuan Chen
2020
Wprowadzenie QKNorm
Punkt przełomowy

Henry i in. proponują QKNorm: normalizację L2 Q i K wzdłuż wymiaru głowicy oraz skalowanie uczonym parametrem zamiast 1/√d; poprawa BLEU o średnio 0,928 na 5 parach niskozasobowych.

2023
Adopcja w ViT-22B (QK LayerNorm)
Punkt przełomowy

Google Research stosuje LayerNorm na Q i K w ViT-22B, aby zapobiec rozbieganiu logitów uwagi i niemal one-hot rozkładom o zerowej entropii przy modelach 8B+.

2025
QK-Norm (RMSNorm) w Qwen3

Qwen3 usuwa bias QKV z Qwen2 i wprowadza QK-Norm (RMSNorm) do mechanizmu uwagi, aby zapewnić stabilny trening.

Hiperparametry (konfigurowalne osie)

Typ normalizacjiWysoka

L2 (oryginał), LayerNorm (ViT-22B) lub RMSNorm (Qwen3).

L2
LayerNorm
RMSNorm
Uczona skala / temperaturaKrytyczna

Parametr g skalujący iloczyn Q·K zamiast 1/√d.

Oś normalizacjiŚrednia

Normalizacja per-głowica wzdłuż head_dim.

head_dim

Złożoność obliczeniowa

Złożoność czasowa: O(n·d) dodatkowo.

Paradygmat wykonania

Tryb główny
Gęsty

Modyfikacja gęstej uwagi; wszystkie głowice i ścieżki są aktywne.

Wzorzec aktywacji
Wszystkie ścieżki aktywne

Równoległość

Poziom równoległości
W pełni równoległy

Normalizacja jest niezależna per token i per głowica, więc jest w pełni równoległa.

Zakres
TreningInferencjaPomiędzy tokenami

Wymagania sprzętowe

Dobry fit

Normalizacja pointwise działa na dowolnym akceleratorze bez specjalnych wymagań.

Podstawowe

Transformery z QK-Norm są trenowane głównie na GPU z Tensor Cores.