Robocikowo>ROBOCIKOWO
Wnioskowanie

Cross-Model KV Cache Transfer

2026BadawczyOpublikowano: 24 sierpnia 2026Aktualizacja: 24 sierpnia 2026Opublikowany
Technika optymalizacji inferencji LLM, w której pamięć KV wygenerowana przez jeden model jest przekształcana i ponownie używana przez inny model z tej samej rodziny, zamiast ponownego prefill.
Kluczowa innowacja
Umożliwia modelowi docelowemu ponowne użycie pamięci KV (klucz-wartość) wyliczonej przez inny model z tej samej rodziny za pomocą wyuczonego odwzorowania liniowego per-głowica, eliminując kosztowny ponowny prefill.
Kategoria
Wnioskowanie
Poziom abstrakcji
Wzorzec
Poziom operacji
InferencjaUdostępnianie
Zastosowania
Serwowanie LLM z dynamicznym przełączaniem modeli (kaskady / routing)Redukcja czasu do pierwszego tokena (TTFT) w długim kontekścieWielomodelowe systemy inferencji współdzielące kontekstKaskady modeli o różnych rozmiarach w obrębie jednej rodziny

Jak działa

1. Model źródłowy przetwarza kontekst wejściowy i tworzy pamięć KV (stany klucz-wartość dla każdej warstwy i głowicy uwagi). 2. Offline kalibruje się zamknięte odwzorowanie liniowe (regresja grzbietowa) osobno dla każdej głowicy, które przekształca stany KV modelu źródłowego w przestrzeń KV modelu docelowego. 3. Wybierane są warstwy źródłowe o najwyższej mocy predykcyjnej względem warstw docelowych. 4. Usuwane jest kodowanie pozycyjne, aby przekształcone stany były niezależne od pozycji i wielokrotnego użytku. 5. Podczas inferencji model docelowy zamiast wykonywać pełny prefill otrzymuje odwzorowane stany KV i od razu przechodzi do dekodowania. Dla trudnych par modeli można zastosować warianty nieliniowe poprawiające dokładność.

Rozwiązany problem

W wdrożeniach produkcyjnych, które dynamicznie przełączają się między modelami o różnych rozmiarach w obrębie jednej rodziny (np. dla balansu kosztu i jakości), każde przełączenie wymaga ponownego, kosztownego przetworzenia całego kontekstu (prefill) przez nowy model. Zwiększa to opóźnienie (czas do pierwszego tokena) i zużycie GPU. Transfer pamięci KV między modelami eliminuje tę redundancję, przenosząc już wyliczony kontekst.

Komponenty

Per-head ridge regression mapperRdzeń transferu — konwersja stanów KV między modelami

Zamknięte odwzorowanie liniowe (regresja grzbietowa) uczone osobno dla każdej głowicy uwagi, przekształcające stany KV modelu źródłowego w przestrzeń KV modelu docelowego.

Source layer selectionDobór najbardziej informatywnych warstw źródłowych

Mechanizm wyboru warstw modelu źródłowego o najwyższej mocy predykcyjnej dla warstw modelu docelowego.

Positional encoding removalZapewnienie niezależności od pozycji

Usunięcie kodowania pozycyjnego ze stanów KV, dzięki czemu przekształcone stany są niezależne od pozycji i możliwe do ponownego użycia.

Calibration datasetDostrojenie odwzorowania przed wdrożeniem

Niewielki zbiór danych używany offline do dopasowania współczynników odwzorowania liniowego.

Implementacja

Pułapki implementacyjne
Ograniczenie do jednej rodziny modeliWysoka

Transfer działa dla modeli dzielących architekturę i tokenizer w obrębie jednej rodziny; nie przenosi się swobodnie między niepowiązanymi modelami.

Rozwiązanie:Stosować wyłącznie w obrębie zweryfikowanej rodziny modeli i kalibrować mapper dla konkretnej pary źródło–cel.
Utrata dokładności na trudnych parachŚrednia

Dla niektórych par modeli dokładność spada poniżej pełnego zakresu 73–98%; odwzorowanie liniowe może nie wystarczyć.

Rozwiązanie:Zastosować warianty nieliniowe odwzorowania dla trudnych par modeli.
Konieczność obsługi kodowania pozycyjnegoŚrednia

Aby przekształcone stany były wielokrotnego użytku, trzeba usunąć kodowanie pozycyjne, co wymaga zgodności ze schematem pozycyjnym modelu.

Rozwiązanie:Usunąć kodowanie pozycyjne przed mapowaniem i ponownie zastosować schemat pozycyjny modelu docelowego.

Ewolucja

Oryginalny paper · 2026 · arXiv preprint · Taekyung Heo
Cross-Model KV Cache Transfer in LLM Families: A Closed-Form Linear Mapping for Prefill Reuse
Taekyung Heo, Rasoul Shafipour, Ritchie Zhao, Maximilian Golub, Mohammad Mahdi Kamani, Ritika Borkar, Makesh Tarun Chandran, Pantea Zardoshti, Bita Darvish Rouhani
2025
Ponowne użycie prefiksowej pamięci KV między modelem bazowym a adaptowanym (Activated LoRA)

Pierwszy silnik serwowania LLM wspierający współdzielenie prefiksowej pamięci KV między modelem bazowym a jego adapterami.

2026
Zamknięte odwzorowanie liniowe dla transferu KV między modelami rodziny
Punkt przełomowy

Odkrycie liniowej struktury par KV między modelami i wprowadzenie zamkniętego odwzorowania per-głowica zastępującego pełny prefill.

Równoległość

Poziom równoległości
W pełni równoległy

Odwzorowanie liniowe stosowane jest niezależnie dla każdej głowicy uwagi i warstwy, więc transfer można w pełni zrównoleglić — w przeciwieństwie do sekwencyjnego prefill.

Zakres
Inferencja

Wymagania sprzętowe

Podstawowe

Technika stosowana w serwowaniu LLM na GPU; samo odwzorowanie to lekka operacja liniowa (mnożenie macierzy) dobrze dopasowana do rdzeni tensorowych.