1) Punkt wyjścia: wstępnie wytrenowany model bazowy. 2) SFT (nadzorowane dostrajanie): trening na wyselekcjonowanych danych dialogowych — parach instrukcja–odpowiedź i rozmowach wielotorowych sformatowanych szablonem czatu z rolami (system/user/assistant) i tokenami specjalnymi. 3) Dostrajanie preferencji: RLHF (trening modelu nagrody na rankingach odpowiedzi, a następnie optymalizacja polityki np. PPO z regularyzacją KL) lub prostsze DPO/APO uczące bezpośrednio z par preferencji, bez osobnego modelu nagrody. 4) Opcjonalnie: rejection sampling, mieszanie checkpointów (model merging), przełączanie trybów rozumowania. Efektem jest model, który interpretuje szablon czatu, utrzymuje kontekst wielu tur i generuje pomocne, zgodne z preferencjami odpowiedzi.
Wstępnie wytrenowany model językowy przewiduje kolejne tokeny, ale nie potrafi w naturalny sposób odpowiadać na polecenia ani prowadzić spójnej, wielotorowej rozmowy zgodnej z intencją użytkownika. Konwersacyjny po-trening rozwiązuje tę lukę behawioralną: uczy model formatu dialogu, podążania za instrukcją, utrzymania kontekstu w wielu turach oraz preferowanych, pomocnych i bezpiecznych odpowiedzi.
Nadzorowane dostrajanie modelu bazowego na wyselekcjonowanych rozmowach i parach instrukcja–odpowiedź, uczące modelu formatu dialogu i podstawowego podążania za instrukcją.
Dostrajanie modelu do preferencji ludzi: RLHF (model nagrody + PPO z karą KL) lub DPO/APO uczące bezpośrednio z par preferencji, poprawiające pomocność i bezpieczeństwo.
Zbiory rozmów wielotorowych i par preferencji (ludzkie lub syntetyczne), stanowiące paliwo etapu po-treningu.
Format ról (system/user/assistant) i tokenów specjalnych, w który osadzane są rozmowy, definiujący interfejs wejścia/wyjścia modelu konwersacyjnego.
OpenAI pokazuje, że SFT na demonstracjach + RLHF na rankingach czynią model użytecznym asystentem podążającym za instrukcją.
Konsumencki asystent czatu oparty na konwersacyjnym po-treningu upowszechnia paradygmat.
Meta publikuje szczegółowy otwarty przepis konwersacyjnego po-treningu z iteracyjnym RLHF.
Rafailov i in. upraszczają wyrównanie preferencji, eliminując osobny model nagrody i pętlę RL.
AI2 udostępnia w pełni otwarty pipeline po-treningu wraz z danymi i kodem.
Hugging Face łączy mid-training rozumowania, SFT, Anchored Preference Optimization i scalanie checkpointów.
Proporcja i dobór zbiorów dialogowych (instrukcje, rozmowy wielotorowe, dane specjalistyczne) w SFT.
Wybór metody wyrównania preferencji: RLHF (PPO), DPO, APO lub warianty.
Siła regularyzacji KL względem modelu referencyjnego w RLHF/DPO, kontrolująca odchylenie od polityki bazowej.
Liczba przejść przez dane SFT; zbyt wiele grozi przeuczeniem i utratą wiedzy z pretrainingu.
Proporcja przykładów wielotorowych względem jednotorowych, wpływająca na utrzymanie kontekstu rozmowy.