Post-Training
Jak działa
Po pretreningu model przechodzi jedną lub kilka faz: (1) SFT na parach instrukcja–odpowiedź; (2) optymalizacja preferencji — trenuje się model nagrody na porównaniach ludzi i optymalizuje politykę (RLHF/PPO) albo stosuje bezpośrednią optymalizację preferencji (DPO); (3) opcjonalnie RLVR z automatyczną, weryfikowalną nagrodą (np. poprawność kodu/matematyki) oraz destylacja z modelu-nauczyciela. Fazy można łączyć i iterować.
Rozwiązany problem
Model bazowy po pretreningu przewiduje tekst, ale nie wykonuje instrukcji, bywa niepomocny lub niebezpieczny i nie trzyma pożądanego formatu. Post-training rozwiązuje lukę między „umie modelować język" a „jest użytecznym asystentem".
Komponenty
Dostrajanie na wysokiej jakości parach instrukcja–odpowiedź.
Dostrajanie do preferencji ludzi przez model nagrody + RL albo bezpośrednio (DPO).
Uczenie ze wzmocnieniem z automatyczną, weryfikowalną nagrodą (kod, matematyka).