Robocikowo>ROBOCIKOWO
Trening

Post-Training

2022AktywnyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
Faza treningu LLM/VLA następująca po pretreningu, obejmująca SFT, RLHF/RLAIF, DPO, instruction tuning, RLVR i destylację.
Kluczowa innowacja
Zbiorcza faza dostrajania modelu bazowego po pretreningu — dopasowanie do zadań, instrukcji i preferencji ludzi zamiast dalszego uczenia surowej wiedzy.
Kategoria
Trening
Poziom abstrakcji
Paradygmat
Poziom operacji
Po-treningTreningModel
Zastosowania
Dopasowanie chatbotów (ChatGPT, Claude, Gemini)Uczenie przestrzegania instrukcjiWzmacnianie rozumowania (RLVR)Redukcja szkodliwych odpowiedzi (alignment)Dostrajanie polityk VLA w robotyce

Jak działa

Po pretreningu model przechodzi jedną lub kilka faz: (1) SFT na parach instrukcja–odpowiedź; (2) optymalizacja preferencji — trenuje się model nagrody na porównaniach ludzi i optymalizuje politykę (RLHF/PPO) albo stosuje bezpośrednią optymalizację preferencji (DPO); (3) opcjonalnie RLVR z automatyczną, weryfikowalną nagrodą (np. poprawność kodu/matematyki) oraz destylacja z modelu-nauczyciela. Fazy można łączyć i iterować.

Rozwiązany problem

Model bazowy po pretreningu przewiduje tekst, ale nie wykonuje instrukcji, bywa niepomocny lub niebezpieczny i nie trzyma pożądanego formatu. Post-training rozwiązuje lukę między „umie modelować język" a „jest użytecznym asystentem".

Komponenty

Nadzorowane dostrajanie (SFT)Bootstrap zachowania asystenta

Dostrajanie na wysokiej jakości parach instrukcja–odpowiedź.

Optymalizacja preferencji (RLHF/DPO)Kształtuje jakość i bezpieczeństwo

Dostrajanie do preferencji ludzi przez model nagrody + RL albo bezpośrednio (DPO).

RLVRWzmacnia rozumowanie

Uczenie ze wzmocnieniem z automatyczną, weryfikowalną nagrodą (kod, matematyka).

Ewolucja

Oryginalny paper · 2022 · NeurIPS 2022 · Long Ouyang
Training language models to follow instructions with human feedback
Long Ouyang, Jeff Wu, Xu Jiang, et al.
2022
InstructGPT formalizuje SFT+RLHF jako standard potreningu
Punkt przełomowy
2023
DPO upraszcza dopasowanie do preferencji bez osobnego modelu nagrody
2025
RLVR staje się kluczowym elementem potreningu modeli rozumujących