Zespół z Shanghai Jiao Tong University, DP Technology, Infinite Frontier i National University of Singapore oddał agentowi Codex GPT-5.6-Sol prowadzenie treningu modelu 27B do kodu przemysłowego. Powstały w ten sposób iCoder-27B trafił razem z raportem technicznym na GitHuba i Hugging Face. Agent zmieniał tu nie prompt ani narzędzia zewnętrzne, lecz same wagi modelu.
Najważniejsze w skrócie
- RTLLM (funkcjonalność, avg@4): 68,0 pkt dla iCoder-27B wobec 49,6 pkt dla bazowego Qwen3.6-27B
- KernelBench L2: 74 poprawne rozwiązania na 100 zadań wobec 28 u modelu bazowego
- Trening prowadzony przez agenta Codex GPT-5.6-Sol w czterech etapach: Data, SFT, OPSD, RLVR
- SFT oparty na 28 952 zweryfikowanych trajektoriach, RLVR na 13 212 zadaniach z weryfikacją wykonawczą
- Wagi, kod i raport techniczny dostępne publicznie na Hugging Face i GitHubie
Człowiek pisze reguły, agent prowadzi eksperymenty
Autorzy streszczają swój podział pracy jako gęstą wiedzę wstępną przy rzadkiej interwencji. Ludzie zapisali doświadczenie badawcze jako wykonywalne Research Skills?Research Skills: Wersjonowane instrukcje spisane przez ludzi: procedury zadań, ograniczenia przepływu pracy i wymagania wobec weryfikatorów. Wyznaczają ramy, w których agent może działać samodzielnie. — cele, granice uprawnień, procedury uruchamiania zadań i wymagania wobec weryfikatorów?Weryfikator (verifier): Narzędzie rozstrzygające o poprawności wygenerowanego kodu przez faktyczne uruchomienie: kompilator, symulator, testbench lub numeryczna wyrocznia.. W tych ramach agent sam wybierał eksperymenty, diagnozował porażki i przepisywał przepis treningowy.
Przepis, na którym ostatecznie stanęło, ma cztery etapy: ewolucję danych, SFT cold start?SFT cold start: Nadzorowane dostrajanie (Supervised Fine-Tuning) na zweryfikowanych trajektoriach modelu-nauczyciela. Nadaje modelowi punkt startowy rozumowania przed fazami uczenia ze wzmocnieniem., samodestylację OPSD i wreszcie RLVR z nagrodą pochodzącą z kompilatora i symulatora.
Cztery etapy przepisu, który agent ustalił samodzielnie:
Skok wobec bazy, nie wobec całej stawki
| Model | RTLLM (funkcjonalność, avg@4) | KernelBench L2 (poprawne / 100) |
|---|---|---|
| iCoder-27B | 68,0 | 74 |
| DeepSeek V4-Pro | 67,5 | — |
| GPT 5.5 | 66,0 | — |
| Qwen3.6-27B (baza) | 49,6 | 28 |
Najmocniejszy wynik to RTLLM, gdzie iCoder wychodzi na pierwsze miejsce w zestawieniu z raportu, przed DeepSeek V4-Pro i GPT 5.5. Przewaga nie jest jednak uniwersalna — na ArchXBench (49,3) i w funkcjonalnej części RealBench (26,7) model zostaje za częścią modeli zamkniętych.
Awarie, które ukształtowały przepis
Raport jest nietypowo szczery co do porażek. Dwie z nich wprost zmieniły kształt przepisu.
Dlaczego to ważne?
Spór o rekurencyjne samodoskonalenie (Recursive Self-Improvement) toczył się dotąd na poziomie prognoz. Ten projekt przenosi go na grunt sprawdzalny: agent utrzymuje długi łańcuch decyzji treningowych, ale każdy jego krok wymaga twardego weryfikatora. Katalog awarii — dziury w nagrodzie, skrzywiony zbiór walidacyjny, limity pamięci — przemawia raczej za wariantem stratnym (Lossy Self-Improvement) niż za gładką krzywą wykładniczą. Wartość ma tu proces, nie samo miejsce w rankingu.
Co dalej?
- Zespół udostępnił pośrednie checkpointy SFT i OPSD obok wersji finalnej, co pozwala niezależnie odtworzyć wkład każdego etapu
- Wyniki pochodzą z jednolitego protokołu ewaluacyjnego zespołu, więc wymagają potwierdzenia w niezależnych testach
- Pętla wciąż nie jest zamknięta — model bazowy, kierunek zadań i granice uprawnień wybiera człowiek
Źródła
- iCoder-27B — Recursive AI-Led Development of a Frontier Industrial Coding Model
- Jiqizhixin — AI到底能不能自己造AI?别吵了,有人做出来了
- GitHub — bingreeky/iCoder





