Model dzieli się na enkoder i dekoder w ramach jednego przyczynowego Transformera z warstwami Mixture-of-Experts. W fazie prefill przetwarzany jest cały kontekst wejściowy (w DeepSeek-V4.1-Flash aktywne jest ok. 8 mld parametrów na token), a w fazie decode, przy generowaniu odpowiedzi, aktywowana jest większa liczba parametrów (ok. 16 mld). Dzięki temu droższe obliczenia zarezerwowane są dla właściwego generowania, a tanie — dla wchłaniania długiego kontekstu.
Klasyczne modele dekoderowe aktywują tę samą, dużą liczbę parametrów zarówno przy przetwarzaniu długiego kontekstu, jak i przy generowaniu każdego tokenu, co jest kosztowne. CED pozwala dopasować koszt obliczeniowy do fazy pracy modelu.
Architektura Causal Encoder-Decoder wprowadzona w modelach DeepSeek-V4 (m.in. V4.1-Flash).