Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

SEED z Tsinghua: samoewoluująca destylacja uczy agentów AI

SEED z Tsinghua: samoewoluująca destylacja uczy agentów AI

Zespół z Wydziału Automatyki Uniwersytetu Tsinghua pod kierunkiem prof. Tao Jianhua przedstawił SEED — „samoewoluującą destylację on-policy”, która wprowadza nadzór post-hoc do treningu agentów AI. Metoda uczy się z zakończonych trajektorii: z sukcesów wyciąga strategie, z porażek reguły korekcji. Pracę opublikowano jako preprint na arXiv (2607.14777).

Najważniejsze w skrócie

  • Na benchmarku ALFWorld SEED poprawia skuteczność o 45,9 punktu procentowego względem bazowego GRPO.
  • Metoda osiąga poziom GRPO przy zużyciu tylko 60% danych treningowych.
  • W zadaniach nowych (unseen) średnia skuteczność rośnie z 70,9% do 86,2%.
  • W zadaniach wizualnych (Sokoban i EZPoints) średnia skuteczność rośnie z 77,0% do 91,0%.
  • SEED bije Skill-Prompt, OPSD, Skill-SD i GRPO na ALFWorld, Search-based QA i WebShop.

Problem: nagroda za wynik nie mówi, co poprawić

W długich, wieloetapowych zadaniach agentowych klasyczny trening ze wzmocnieniem opartym na wyniku ma lukę. Model dostaje sygnał tylko o tym, czy zadanie się udało, czy nie — ale nie wie, które konkretne obserwacje, akcje czy wywołania narzędzi w trajektorii: Pełny przebieg agenta: sekwencja obserwacji, akcji i końcowego wyniku w jednym zadaniu. zasłużyły na wzmocnienie.

Przy dziesiątkach kroków to jak ocena całego egzaminu jedną literą: zdał albo nie zdał, bez wskazania, które odpowiedzi były dobre. Autorzy z Tsinghua atakują tę lukę pomysłem, który nazywają nadzorem post-hoc (事后监督) — czyli uczeniem się z perspektywy czasu, po zakończeniu trajektorii.

Zamiast oceniać tylko końcowy wynik, SEED analizuje całą ścieżkę i wyciąga z niej „umiejętności z perspektywy” (hindsight skills): powtarzalne strategie z udanych przebiegów oraz reguły korekcji i unikania błędów z porażek. Te wnioski są następnie destylowane z powrotem do modelu-polityki.

Jak działa SEED

Framework działa w dwóch etapach. W pierwszym — Hindsight Skill SFT: Supervised fine-tuning — dostrajanie modelu na parach wejście–pożądane wyjście. — system zbiera trajektorie bazowej polityki, a zewnętrzny analizator streszcza całe przebiegi w „umiejętności z perspektywy”. Pary trajektoria–umiejętność służą potem do dostrojenia modelu.

W drugim etapie zaczyna się właściwa „samoewolucja”. Ta sama polityka jednocześnie próbkuje nowe trajektorie zadań i pełni rolę analizatora, wydobywając powtarzalne umiejętności. System porównuje decyzje modelu podejmowane z dostępem do tych umiejętności i bez nich, a różnicę zamienia na sygnał treningowy destylacji on-policy (OPD), optymalizowany równolegle z GRPO. W praktyce model uczy się sam siebie — używa własnych wniosków z przeszłości jako nauczyciela.

Wyniki i porównanie

Najmocniejszy wynik pochodzi z benchmarku ALFWorld: SEED poprawia skuteczność o 45,9 punktu procentowego względem samego GRPO. Równie istotny jest inny rezultat — metoda osiąga poziom GRPO, zużywając zaledwie 60% danych treningowych. Nadzór post-hoc nie tylko podnosi sufit możliwości, ale też zwiększa efektywność danych.

TestGRPOSEED
ALFWorld (skuteczność)baza+45,9 pkt proc.
Zadania nieoglądane (unseen)70,9%86,2%
Zadania wizualne (Sokoban, EZPoints)77,0%91,0%
Dane do osiągnięcia poziomu GRPO100%60%
SEED vs GRPO — wyniki

Poprawa utrzymuje się poza danymi treningowymi. W bezpośrednim porównaniu SEED wypada lepiej niż metody oparte na promptowaniu umiejętnościami (Skill-Prompt), warianty destylacji (OPSD, Skill-SD) oraz czyste GRPO — i to na trzech różnych rodzinach zadań: ALFWorld, wyszukiwaniu (Search-based QA) i WebShop.

Dlaczego to ważne?

SEED trafia w jedno z głównych wąskich gardeł agentów AI: rzadki sygnał nagrody w długich zadaniach. Trening oparty wyłącznie na wyniku marnuje większość informacji zawartej w trajektorii, bo nie potrafi jej przypisać do konkretnych decyzji. Zamiana ukończonych przebiegów w konkretne, powtarzalne wnioski to sposób na gęstszy sygnał uczący bez ręcznego etykietowania każdego kroku.

Szczególnie istotny jest wynik dotyczący danych: poziom GRPO przy 60% danych oznacza, że metoda może obniżyć koszt treningu agentów, a nie tylko poprawić ich skuteczność. Zastrzeżenie: to wyniki z konkretnych benchmarków, a nie z otwartego, produkcyjnego środowiska — przeniesienie na realne, długie zadania pozostaje do sprawdzenia.

Co dalej?

  • Praca jest preprintem na arXiv (2607.14777) — recenzja i publikacja konferencyjna dopiero przed nią.
  • Metodę zweryfikowano na ALFWorld, Search-based QA, WebShop oraz zadaniach wizualnych — kolejnym krokiem będzie test na trudniejszych, dłuższych zadaniach agentowych.
  • Otwartą kwestią pozostaje, jak SEED zachowa się przy większych modelach i realnych narzędziach, gdzie analizator-polityka może popełniać własne błędy.

Źródła

Udostępnij ten artykuł