Badacze Salesforce opublikowali DarwinX — framework, który ewolucyjnie optymalizuje harness agenta AI przy całkowicie zamrożonych wagach modelu. Na benchmarku WebArena-Infinity skuteczność wzrosła z 43,5% do 93%. Praca trafiła na arXiv 31 lipca 2026, a szerszy opis metody ukazał się 16 września.
Najważniejsze w skrócie
- WebArena-Infinity: 43,5% → 93% pass@1 przy zamrożonym GPT-5.5
- Terminal-Bench 2.1: wzrost o 7,7 punktu, do 83,2%
- SWE-bench Verified: 80,8% → 84,2% w teście przenoszalności
- TerminalWorld: 68,3% na zadaniach spoza zbioru treningowego
- Framework Beagle udostępniony na licencji Apache 2.0
Ewolucja zamiast przepisywania
Harness?Harness: Warstwa wokół modelu: prompty systemowe, definicje narzędzi, skille i workflow. Model jej nie zawiera — to kod, który nim steruje. to wszystko, co otacza model: prompty, definicje narzędzi, skille, workflow. Zwykle poprawia się go ręcznie — ktoś zauważa błąd, zmienia prompt, sprawdza, czy pomogło.
DarwinX zamienia to w optymalizację ewolucyjną. System utrzymuje archiwum wielu wariantów harnessu naraz i traktuje samodoskonalenie agenta jako selekcję w populacji, przy nietkniętych wagach modelu. Zamiast w kółko nadpisywać jedną wersję, generuje i ocenia wiele równoległych gałęzi.
Trzy mechanizmy, które trzymają populację w ryzach
Autorzy z Salesforce wskazują trzy elementy odróżniające DarwinX od zwykłego przeszukiwania promptów. Pierwszy to kontrakt „preserve-and-extend" — wariant może dodać funkcję, ale nie może zepsuć zadania, które wcześniej działało. Drugi to archiwum alternatywnych ścieżek rozwoju, dzięki któremu specjalistyczne gałęzie o komplementarnych mocnych stronach można później połączyć. Trzeci to wspólny interfejs wchłaniający poprawki z trzech źródeł: analizy porażek, podpowiedzi modelu-nauczyciela i samodzielnych propozycji agenta.
Co to znaczy w liczbach
| Benchmark | Przed | Po |
|---|---|---|
| WebArena-Infinity (pass@1) | 43,5% | 93,0% |
| Terminal-Bench 2.1 | 75,5% | 83,2% |
| SWE-bench Verified (transfer) | 80,8% | 84,2% |
| TerminalWorld (held-out) | 61,0% | 68,3% |
Najmocniejszy wynik to WebArena-Infinity, gdzie agent oparty na zamrożonym GPT-5.5 poszedł z 43,5% do 93% ukończonych zadań przeglądarkowych. Na Terminal-Bench 2.1 przyrost jest skromniejszy, ale istotniejszy jest test przenoszalności: harness wypracowany na Terminal-Bench podniósł wynik na SWE-bench Verified bez żadnych modyfikacji. Metodę sprawdzono też na Claude Opus 4.8, a na zadaniach held-out z TerminalWorld harness utrzymał przewagę.
Dlaczego to ważne?
Jeśli harness da się optymalizować automatycznie, granica możliwości agenta przestaje leżeć wyłącznie w modelu. To zmienia rachunek kosztów: zamiast czekać na kolejną generację wag, można wycisnąć kilkadziesiąt punktów z warstwy kontrolowanej przez zespół wdrożeniowy. Ryzyko jest po drugiej stronie — harness wyewoluowany pod konkretny benchmark może okazać się przeuczony, a transfer na SWE-bench to dopiero jeden punkt odniesienia.
Co dalej?
- Framework Beagle jest dostępny na GitHubie na licencji Apache 2.0, co pozwala niezależnie odtworzyć wyniki
- Praca raportuje wyniki dla GPT-5.5 i Claude Opus 4.8 — przenoszalność na modele otwarte pozostaje niesprawdzona
- SWE-bench Verified jest jedynym raportowanym pomiarem transferu poza domenę, w której harness ewoluował





