CSA2 wybiera rzadki podzbiór połączeń uwagi zamiast liczyć pełną macierz gęstą, a stany klucz-wartość zapisuje w skompresowanym formacie FP4. Technika SWA Bounded Replay odtwarza brakujące stany KV okna przesuwnego zamiast trzymać je wszystkie w pamięci, dzięki czemu trwały cache KV jest wielokrotnie mniejszy. Razem obniża to zapotrzebowanie na pamięć i przepustowość, przyspieszając inferencję przy długich kontekstach.
Standardowa gęsta uwaga wymaga pamięci rosnącej z długością kontekstu, a pełny cache KV przy oknie 1M tokenów jest zbyt duży. CSA2 ogranicza ten koszt przez rzadkość i kompresję FP4.
Druga generacja skompresowanej, rzadkiej uwagi z cache KV w FP4 wprowadzona w rodzinie DeepSeek-V4.