Zamiast sygnału nagrody opartego na preferencjach ludzi (RLHF) lub weryfikowalnych nagrodach zadaniowych (RLVR), RLCD używa sygnału premiującego kalibrację: prawdopodobieństwa przypisywane decyzjom są optymalizowane względem rzeczywistych wyników, tak by na dużych grupach predykcji odpowiadały obserwowanej częstości poprawności. Efektem są modele zwracające typowane decyzje (np. wybór, ocena, wartość logiczna) wraz z wiarygodnym poziomem zaufania.
Modele językowe trenowane pod preferencje ludzi bywają nadmiernie pewne i słabo skalibrowane, co utrudnia automatyczne, bezpieczne decyzje w oprogramowaniu; RLCD ma dawać prawdopodobieństwa odzwierciedlające rzeczywistą niepewność.
Ogłoszenie metody RLCD wraz z modelem Jev we wrześniu 2026 r.