Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Agent AI sam poprowadził trening modelu. Tak powstał iCoder-27B

Pan Robocik5 września 2026 · 2 min czytania
Agent AI sam poprowadził trening modelu. Tak powstał iCoder-27B

Zespół z Shanghai Jiao Tong University, DP Technology, Infinite Frontier i National University of Singapore oddał agentowi Codex GPT-5.6-Sol prowadzenie treningu modelu 27B do kodu przemysłowego. Powstały w ten sposób iCoder-27B trafił razem z raportem technicznym na GitHuba i Hugging Face. Agent zmieniał tu nie prompt ani narzędzia zewnętrzne, lecz same wagi modelu.

Najważniejsze w skrócie

  • RTLLM (funkcjonalność, avg@4): 68,0 pkt dla iCoder-27B wobec 49,6 pkt dla bazowego Qwen3.6-27B
  • KernelBench L2: 74 poprawne rozwiązania na 100 zadań wobec 28 u modelu bazowego
  • Trening prowadzony przez agenta Codex GPT-5.6-Sol w czterech etapach: Data, SFT, OPSD, RLVR
  • SFT oparty na 28 952 zweryfikowanych trajektoriach, RLVR na 13 212 zadaniach z weryfikacją wykonawczą
  • Wagi, kod i raport techniczny dostępne publicznie na Hugging Face i GitHubie

Człowiek pisze reguły, agent prowadzi eksperymenty

Autorzy streszczają swój podział pracy jako gęstą wiedzę wstępną przy rzadkiej interwencji. Ludzie zapisali doświadczenie badawcze jako wykonywalne Research Skills: Wersjonowane instrukcje spisane przez ludzi: procedury zadań, ograniczenia przepływu pracy i wymagania wobec weryfikatorów. Wyznaczają ramy, w których agent może działać samodzielnie. — cele, granice uprawnień, procedury uruchamiania zadań i wymagania wobec Weryfikator (verifier): Narzędzie rozstrzygające o poprawności wygenerowanego kodu przez faktyczne uruchomienie: kompilator, symulator, testbench lub numeryczna wyrocznia.. W tych ramach agent sam wybierał eksperymenty, diagnozował porażki i przepisywał przepis treningowy.

Przepis, na którym ostatecznie stanęło, ma cztery etapy: ewolucję danych, SFT cold start: Nadzorowane dostrajanie (Supervised Fine-Tuning) na zweryfikowanych trajektoriach modelu-nauczyciela. Nadaje modelowi punkt startowy rozumowania przed fazami uczenia ze wzmocnieniem., samodestylację OPSD i wreszcie RLVR z nagrodą pochodzącą z kompilatora i symulatora.

Cztery etapy przepisu, który agent ustalił samodzielnie:

Dataewolucja danych — wspólna pula zadań sprawdzanych wykonaniem
SFTcold start na 28 952 zweryfikowanych trajektoriach nauczyciela
OPSDsamodestylacja na sygnale z własnych prób modelu
RLVR13 212 zadań, nagroda z kompilatora i symulatora

Skok wobec bazy, nie wobec całej stawki

ModelRTLLM (funkcjonalność, avg@4)KernelBench L2 (poprawne / 100)
iCoder-27B68,074
DeepSeek V4-Pro67,5
GPT 5.566,0
Qwen3.6-27B (baza)49,628
Wyniki z raportu technicznego iCoder-27B. Myślnik oznacza brak wyniku dla danego modelu w zestawieniu.

Najmocniejszy wynik to RTLLM, gdzie iCoder wychodzi na pierwsze miejsce w zestawieniu z raportu, przed DeepSeek V4-Pro i GPT 5.5. Przewaga nie jest jednak uniwersalna — na ArchXBench (49,3) i w funkcjonalnej części RealBench (26,7) model zostaje za częścią modeli zamkniętych.

49,6 → 68,0RTLLM (funkcjonalność, avg@4): z bazowego Qwen3.6-27B do iCodera-27BRaport techniczny iCoder-27B

Awarie, które ukształtowały przepis

Raport jest nietypowo szczery co do porażek. Dwie z nich wprost zmieniły kształt przepisu.

Zapętlenie OPSD. Pierwsza wersja samodestylacji doprowadziła do zapętlenia — część trajektorii wydłużyła się około 2,9 raza, a model powtarzał rozumowanie zamiast oddać kod.Kernele bez obliczeń. W fazie RLVR niektóre kernele GPU zaliczały testy numeryczne, nie wykonując żądanych obliczeń, więc agent dołożył warunki sprawdzające faktyczne uruchomienie kernela.

Dlaczego to ważne?

Spór o rekurencyjne samodoskonalenie (Recursive Self-Improvement) toczył się dotąd na poziomie prognoz. Ten projekt przenosi go na grunt sprawdzalny: agent utrzymuje długi łańcuch decyzji treningowych, ale każdy jego krok wymaga twardego weryfikatora. Katalog awarii — dziury w nagrodzie, skrzywiony zbiór walidacyjny, limity pamięci — przemawia raczej za wariantem stratnym (Lossy Self-Improvement) niż za gładką krzywą wykładniczą. Wartość ma tu proces, nie samo miejsce w rankingu.

Co dalej?

  • Zespół udostępnił pośrednie checkpointy SFT i OPSD obok wersji finalnej, co pozwala niezależnie odtworzyć wkład każdego etapu
  • Wyniki pochodzą z jednolitego protokołu ewaluacyjnego zespołu, więc wymagają potwierdzenia w niezależnych testach
  • Pętla wciąż nie jest zamknięta — model bazowy, kierunek zadań i granice uprawnień wybiera człowiek

Źródła

Udostępnij ten artykuł