Robocikowo>ROBOCIKOWO
Wnioskowanie

Re-prefill

AktywnyOpublikowano: 24 sierpnia 2026Aktualizacja: 24 sierpnia 2026Opublikowany
Ponowne, pełne wyliczenie pamięci KV dla całego kontekstu przez model, wykonywane gdy istniejący cache staje się nieaktualny lub niedostępny. Baseline serwowania LLM.
Kluczowa innowacja
Nie jest optymalizacją — to podstawowa, „naiwna" operacja odtworzenia całej pamięci KV od zera, stanowiąca punkt odniesienia (baseline), który liczne techniki cache'owania i transferu KV starają się wyeliminować.
Kategoria
Wnioskowanie
Poziom abstrakcji
Building block
Poziom operacji
InferencjaUdostępnianie
Zastosowania
Odtworzenie cache po eksmisji z pamięci GPUFallback po edycji kontekstu w pętli agentowejPrzetworzenie kontekstu po zmianie prefiksu promptuBaseline porównawczy dla technik cache'owania i transferu KV

Jak działa

1. Model pobiera cały (lub cały zmieniony) kontekst wejściowy. 2. Wykonuje pełny przebieg w przód przez wszystkie warstwy, licząc od nowa klucze (K) i wartości (V) dla każdego tokena i każdej głowicy uwagi. 3. Nowo policzone stany zapełniają KV cache. 4. Model generuje pierwszy token i przechodzi do fazy dekodowania korzystającej z odtworzonego cache. Ponieważ jest to pełny prefill, koszt uwagi rośnie kwadratowo z długością kontekstu, a całość jest wykonywana za każdym razem, gdy dotychczasowy cache został unieważniony.

Rozwiązany problem

Gdy pamięć KV staje się nieaktualna lub niedostępna (eksmisja z pamięci, edycja kontekstu, zmiana prefiksu, przełączenie modelu), dekodowanie nie może kontynuować w oparciu o błędny lub brakujący cache. Re-prefill zapewnia poprawność, odtwarzając stany KV od zera — kosztem czasu i mocy obliczeniowej.

Implementacja

Pułapki implementacyjne
Pełny koszt rekomputacji przy każdej inwalidacjiWysoka

Każda edycja kontekstu lub eksmisja cache wymusza pełny re-prefill, co znacząco podnosi czas do pierwszego tokena (TTFT).

Rozwiązanie:Stosować prefix caching, ponowne użycie/transfer pamięci KV oraz stabilizować prefiksy promptów, aby unikać inwalidacji.
Kwadratowe skalowanie z długością kontekstuWysoka

Koszt uwagi w prefill rośnie jak O(n²), więc re-prefill długiego kontekstu jest szczególnie kosztowny.

Rozwiązanie:Zastosować chunked prefill oraz techniki kompresji/redukcji kontekstu.

Ewolucja

2026
Transfer pamięci KV między modelami jako alternatywa dla re-prefill

Wykazano, że można pominąć re-prefill po przełączeniu modelu, przenosząc pamięć KV między modelami rodziny — 2,7–25× szybciej niż ponowny prefill.

Złożoność obliczeniowa

Złożoność czasowa: O(n² · d). Złożoność przestrzenna: O(n · d · L).

Paradygmat wykonania

Tryb główny
Gęsty

Prefill to gęste obliczenie: wszystkie tokeny kontekstu przechodzą przez wszystkie warstwy w jednym przebiegu.

Wzorzec aktywacji
Wszystkie ścieżki aktywne

Równoległość

Poziom równoległości
W pełni równoległy

W odróżnieniu od sekwencyjnego dekodowania, prefill (a więc i re-prefill) przetwarza wszystkie tokeny kontekstu równolegle w jednym przebiegu w przód.

Zakres
InferencjaPomiędzy tokenami

Wymagania sprzętowe

Podstawowe

Re-prefill jest ograniczony obliczeniowo i zdominowany mnożeniami macierzy (GEMM), co idealnie pasuje do rdzeni tensorowych GPU.