Zespół badawczy Nvidii pokazał w pracy opublikowanej na arXiv 21 sierpnia 2026, że prosta regresja liniowa potrafi przenieść pamięć kontekstu (KV cache?KV cache: Pamięć podręczna kluczy i wartości (key/value) z mechanizmu uwagi — przechowuje przeliczony kontekst rozmowy, by model nie liczył go od nowa przy każdym tokenie.) z jednego modelu do drugiego w tej samej rodzinie, bez przeliczania całej rozmowy od zera. Technika, nazwana cross-model KV cache transfer, przyspiesza przełączanie modeli od 2,7 do 25 razy i zachowuje nawet 98% dokładności modelu docelowego.
Najważniejsze w skrócie
- Technika: cross-model KV cache transfer oparta na regresji grzbietowej (ridge regression), bez treningu sieci neuronowej.
- Przyspieszenie: od 2,7 do 25 razy względem ponownego przeliczania rozmowy (re-prefill).
- Dokładność: od 73% do 98% wyniku modelu docelowego dla zgodnych par.
- Przykład: przeniesienie cache 32 768 tokenów z Qwen3 14B do 32B zajęło 278 ms zamiast około 7 sekund.
- Zakres testów: 6 par modeli z rodzin Qwen3, Llama 3.1 i Ministral 3, od 3B do 70B parametrów.
Każde przełączenie modelu kosztuje
W systemach, które łączą kilka modeli językowych, częstą praktyką jest przekazywanie zadania z małego modelu do dużego (lub odwrotnie) w trakcie rozmowy. Problem w tym, że model przejmujący musi przeliczyć cały dotychczasowy kontekst od nowa. To podnosi koszt obliczeń i opóźnienie — im dłuższa rozmowa, tym dotkliwiej. Dla firm budujących wieloetapowe procesy z agentami AI ten narzut staje się realnym wąskim gardłem.
Odkrycie: KV cache jest w dużej mierze liniowy
Sednem pracy jest obserwacja, że powiązanie między pamięcią kontekstu dwóch modeli ma w dużej mierze strukturę liniową — a więc można je odtworzyć bez kosztownego uczenia głębokiego. Rozwiązanie ma trzy elementy: regresję grzbietową dopasowaną osobno dla każdej głowicy uwagi (wystarcza 500 sekwencji kalibracyjnych), wybór najbardziej przewidujących warstw źródłowych oraz mapowanie w przestrzeni treści z usunięciem kodowania pozycji RoPE, co pozwala uogólniać wynik na różne długości sekwencji. Dla pary Qwen3 14B do 32B pojedyncza warstwa źródłowa odtwarza 56% wariancji kluczy, a wiele warstw — już 79%.
Znaczenie symboli
- …
- dopasowana macierz mapująca, osobna dla każdej głowicy uwagi
- …
- klucze KV modelu źródłowego
- …
- klucze KV modelu docelowego
- …
- współczynnik regularyzacji grzbietowej
Gdzie metoda się załamuje
Im większy skok wielkości między modelami, tym trudniejsze mapowanie. Przy 8,8-krotnej różnicy parametrów (Llama 3.1 8B do 70B) technika zachowała 72,8% dokładności modelu docelowego — zauważalnie mniej niż dla par zbliżonych rozmiarem. Dla najtrudniejszych przypadków autorzy dokładają opcjonalną, nieliniową warstwę MLP, która na teście HellaSwag odzyskuje do 37 punktów procentowych. To pokazuje granicę: samo mapowanie liniowe wystarcza dla zgodnych par, ale nie jest uniwersalne.
| Operacja | Czas |
|---|---|
| Ponowne przeliczenie kontekstu (re-prefill) | ~7 s |
| Cross-model KV cache transfer | 278 ms |
Dlaczego to ważne?
Wieloetapowe systemy z agentami AI liczą się z kosztem każdego przełączenia modelu. Jeśli narzut prefillu?Prefill: Wstępne przeliczenie całego dotychczasowego kontekstu przez model, zanim zacznie generować odpowiedź. Przy długiej rozmowie to najdroższy etap. da się zbić z sekund do ułamków sekundy prostą algebrą, tańsze staje się dynamiczne dobieranie modelu do trudności zadania — mały do rutyny, duży do trudnych fragmentów. To przesuwa opłacalność architektur, w których modele współpracują, zamiast działać w pojedynkę.
Co dalej?
- Praca jest wynikiem badawczym na arXiv (2608.03893) — brak zapowiedzi wdrożenia produkcyjnego w stosie Nvidii.
- Metodę przetestowano tylko wewnątrz rodzin modeli — transfer między różnymi rodzinami pozostaje otwartym pytaniem.





