Punktem wyjscia jest otwarty model Qwen3-32B. Zamiast SFT stosuje sie uczenie ze wzmocnieniem (framework rLLM): agent rozwiazuje zadania programistyczne w srodowisku wykonawczym, a sygnal nagrody pochodzi ze sprawdzalnej poprawnosci (np. zaliczenie testow/rozwiazanie zadania SWE-Bench). Model uczy sie planowac, edytowac kod i weryfikowac wyniki w wielu krokach. Dodatkowo stosowane jest skalowanie w czasie inferencji (test-time scaling), np. generowanie i wybor wielu rozwiazan, co podnosi skutecznosc (Pass@16, 59% z test-time scaling).
Silne agenty kodujace zwykle wymagaja kosztownego nadzorowanego fine-tuningu na duzych zbiorach demonstracji. DeepSWE pokazuje, ze mozna je uzyskac wylacznie przez RL z otwartego modelu, w pelni otwarcie i odtwarzalnie.
Otwarty model jezykowy, od ktorego rozpoczyna sie trening agenta.
Oficjalna
Czyste uczenie ze wzmocnieniem w frameworku rLLM, bez nadzorowanego fine-tuningu.
Sygnal nagrody z obiektywnej weryfikacji rozwiazan (zaliczenie testow).
Generowanie i selekcja wielu rozwiazan przy inferencji dla wyzszej skutecznosci.
Oficjalna
RL wymaga wiarygodnego, obiektywnego sygnalu (np. testow); dla zadan bez jasnej weryfikacji podejscie jest trudniejsze.
Trening agenta RL w srodowiskach wykonawczych jest kosztowny obliczeniowo i inzyniersko.
2 lipca 2025 udostepniono otwartego agenta kodujacego wytrenowanego wylacznie RL z Qwen3-32B, z pelnym przepisem treningowym i wagami; SOTA wsrod agentow open-weight na SWE-Bench-Verified.