DarwinX to opisany w preprincie framework do ewolucyjnego samodoskonalenia agentów LLM. Zamiast dostrajać wagi modelu, ewoluuje jego „harness" — prompty, narzędzia, skille i przepływ sterowania — traktując samo-ewolucję jako selekcję na populacji harnessów przy zamrożonym modelu. Kluczowe mechanizmy to: „preserve-and-extend contract" (dopuszczający tylko warianty poszerzające pokrycie bez regresji), archiwum utrzymujące alternatywne linie rozwojowe oraz ujednolicony interfejs dowodów (evidence). Fitness pochodzi z weryfikatorów benchmarkowych, a nie z wzorcowych rozwiązań.
DarwinX rozwiązuje problem regresji zadań przy jednoliniowym samodoskonaleniu, umożliwiając wielościeżkową ewolucję, która dodaje zdolności bez utraty istniejącego pokrycia. Wyniki z abstraktu: Terminal-Bench 2.1 — 83,2%, TerminalWorld — 68,3%, WebArena-Infinity — 93,0% (pass@1), przy średniej poprawie ok. 17 punktów na pętlę ewolucji; wyewoluowane harnessy przenoszą się między benchmarkami i modelami bazowymi. Preprint ukazał się 31 lipca 2026 r. (Salesforce AI Research), a oficjalna implementacja jest open-source w ramach platformy Beagle.