Zespół z Wydziału Automatyki Uniwersytetu Tsinghua pod kierunkiem prof. Tao Jianhua przedstawił SEED — „samoewoluującą destylację on-policy”, która wprowadza nadzór post-hoc do treningu agentów AI. Metoda uczy się z zakończonych trajektorii: z sukcesów wyciąga strategie, z porażek reguły korekcji. Pracę opublikowano jako preprint na arXiv (2607.14777).
Najważniejsze w skrócie
- Na benchmarku ALFWorld SEED poprawia skuteczność o 45,9 punktu procentowego względem bazowego GRPO.
- Metoda osiąga poziom GRPO przy zużyciu tylko 60% danych treningowych.
- W zadaniach nowych (unseen) średnia skuteczność rośnie z 70,9% do 86,2%.
- W zadaniach wizualnych (Sokoban i EZPoints) średnia skuteczność rośnie z 77,0% do 91,0%.
- SEED bije Skill-Prompt, OPSD, Skill-SD i GRPO na ALFWorld, Search-based QA i WebShop.
Problem: nagroda za wynik nie mówi, co poprawić
W długich, wieloetapowych zadaniach agentowych klasyczny trening ze wzmocnieniem opartym na wyniku ma lukę. Model dostaje sygnał tylko o tym, czy zadanie się udało, czy nie — ale nie wie, które konkretne obserwacje, akcje czy wywołania narzędzi w trajektorii?trajektorii: Pełny przebieg agenta: sekwencja obserwacji, akcji i końcowego wyniku w jednym zadaniu. zasłużyły na wzmocnienie.
Przy dziesiątkach kroków to jak ocena całego egzaminu jedną literą: zdał albo nie zdał, bez wskazania, które odpowiedzi były dobre. Autorzy z Tsinghua atakują tę lukę pomysłem, który nazywają nadzorem post-hoc (事后监督) — czyli uczeniem się z perspektywy czasu, po zakończeniu trajektorii.
Zamiast oceniać tylko końcowy wynik, SEED analizuje całą ścieżkę i wyciąga z niej „umiejętności z perspektywy” (hindsight skills): powtarzalne strategie z udanych przebiegów oraz reguły korekcji i unikania błędów z porażek. Te wnioski są następnie destylowane z powrotem do modelu-polityki.
Jak działa SEED
Framework działa w dwóch etapach. W pierwszym — Hindsight Skill SFT?SFT: Supervised fine-tuning — dostrajanie modelu na parach wejście–pożądane wyjście. — system zbiera trajektorie bazowej polityki, a zewnętrzny analizator streszcza całe przebiegi w „umiejętności z perspektywy”. Pary trajektoria–umiejętność służą potem do dostrojenia modelu.
W drugim etapie zaczyna się właściwa „samoewolucja”. Ta sama polityka jednocześnie próbkuje nowe trajektorie zadań i pełni rolę analizatora, wydobywając powtarzalne umiejętności. System porównuje decyzje modelu podejmowane z dostępem do tych umiejętności i bez nich, a różnicę zamienia na sygnał treningowy destylacji on-policy (OPD), optymalizowany równolegle z GRPO. W praktyce model uczy się sam siebie — używa własnych wniosków z przeszłości jako nauczyciela.
Wyniki i porównanie
Najmocniejszy wynik pochodzi z benchmarku ALFWorld: SEED poprawia skuteczność o 45,9 punktu procentowego względem samego GRPO. Równie istotny jest inny rezultat — metoda osiąga poziom GRPO, zużywając zaledwie 60% danych treningowych. Nadzór post-hoc nie tylko podnosi sufit możliwości, ale też zwiększa efektywność danych.
| Test | GRPO | SEED |
|---|---|---|
| ALFWorld (skuteczność) | baza | +45,9 pkt proc. |
| Zadania nieoglądane (unseen) | 70,9% | 86,2% |
| Zadania wizualne (Sokoban, EZPoints) | 77,0% | 91,0% |
| Dane do osiągnięcia poziomu GRPO | 100% | 60% |
Poprawa utrzymuje się poza danymi treningowymi. W bezpośrednim porównaniu SEED wypada lepiej niż metody oparte na promptowaniu umiejętnościami (Skill-Prompt), warianty destylacji (OPSD, Skill-SD) oraz czyste GRPO — i to na trzech różnych rodzinach zadań: ALFWorld, wyszukiwaniu (Search-based QA) i WebShop.
Dlaczego to ważne?
SEED trafia w jedno z głównych wąskich gardeł agentów AI: rzadki sygnał nagrody w długich zadaniach. Trening oparty wyłącznie na wyniku marnuje większość informacji zawartej w trajektorii, bo nie potrafi jej przypisać do konkretnych decyzji. Zamiana ukończonych przebiegów w konkretne, powtarzalne wnioski to sposób na gęstszy sygnał uczący bez ręcznego etykietowania każdego kroku.
Szczególnie istotny jest wynik dotyczący danych: poziom GRPO przy 60% danych oznacza, że metoda może obniżyć koszt treningu agentów, a nie tylko poprawić ich skuteczność. Zastrzeżenie: to wyniki z konkretnych benchmarków, a nie z otwartego, produkcyjnego środowiska — przeniesienie na realne, długie zadania pozostaje do sprawdzenia.
Co dalej?
- Praca jest preprintem na arXiv (2607.14777) — recenzja i publikacja konferencyjna dopiero przed nią.
- Metodę zweryfikowano na ALFWorld, Search-based QA, WebShop oraz zadaniach wizualnych — kolejnym krokiem będzie test na trudniejszych, dłuższych zadaniach agentowych.
- Otwartą kwestią pozostaje, jak SEED zachowa się przy większych modelach i realnych narzędziach, gdzie analizator-polityka może popełniać własne błędy.
Źródła
- 36Kr — 清华陶建华团队提出「自进化同策略蒸馏」SEED
- arXiv — SEED (2607.14777)





