EverMind AI udostępniło 23 września Ravena 0.2.0 — otwartoźródłowy framework, który sam siebie nazywa „harnessem harnessów”. Jego teza: agent poprawia się bez ruszania wag modelu, jeśli pozwolić mu przepisywać własną warstwę sterującą. Cztery dni później doszedł 82-stronicowy raport techniczny.
Najważniejsze w skrócie
- Raven 0.2.0 wydany 23 września 2026 na licencji Apache-2.0
- Pętla agenta rozbita na cztery moduły — Memory, Planning, Capability, Action — przepisywane przez Curatora
- 13 gotowych presetów agentów zewnętrznych, m.in. Claude Code, Codex i GitHub Copilot
- Raven RSI: 172 przebiegi treningowe w 7 rundach bez awarii, val_bpb niższy o 5,8%
Samopoprawa w warstwie sterującej
Raven rozbija pętlę agenta na cztery moduły strategii. Nad nimi siedzi Curator?Curator: Eksperymentalny moduł Ravena, który przepisuje cztery moduły strategii agenta — raz jako ustawienie, raz jako mały kawałek kodu oceniającego. i przepisuje te cztery miejsca: raz jako ustawienie, raz jako mały kawałek kodu oceniającego.
| Moduł strategii | Co obejmuje |
|---|---|
| Memory | Co tura widzi |
| Planning | Jak agent podchodzi do pracy |
| Capability | Jakie narzędzia są udostępnione |
| Action | Wybór następnego ruchu i ocena przed wykonaniem |
Bezpieczniki są dwa. Nic nie trafia do agenta bez weryfikacji, a sygnały z rundy docierają z wyciętą odpowiedzią wzorcową. Curator jest eksperymentalny i jedzie z repozytorium, nie z instalowanym pakietem.
Trzynastu agentów pod jednym dyrygentem
Druga połowa pomysłu to orkiestracja. Raven działa jako Host Agent: rozbija cel na podzadania, dobiera agentów, pilnuje zależności i skleja wyniki.
Czterech ma własnych — Raven-Research, Raven-Code, Raven-Design i Raven-Oncall — a resztę podłącza przez ACP?ACP: Agent Client Protocol — otwarty protokół JSON-RPC, przez który program-host lub edytor rozmawia z zewnętrznym agentem kodującym. Nie mylić z Agent Communication Protocol o tym samym skrócie., CLI albo API zgodne z OpenAI. Presetów jest trzynaście, z Claude Code i Codeksem na czele.
Liczby z własnej ławki
Najmocniejszą demonstracją jest Raven RSI: system dostał zadanie i kryteria oceny, których nie mógł zmieniać, po czym sam planował rundy, pisał kod i uruchamiał eksperymenty. Przy pretreningu nanochat zszedł o 5,8% z val_bpb w 172 przebiegach, bez ani jednej awarii.
Tę samą tezę testuje DarwinX od Salesforce, który podniósł skuteczność agenta z 43,5% do 93% na WebArena-Infinity. Różnica leży w zakresie: DarwinX szlifuje harness jednego agenta, Raven robi to na zespole obcych narzędzi. Wyniki pochodzą z materiałów samego EverMind, a projekt jest pre-alpha.
Dlaczego to ważne?
Jeśli postęp da się kupić przepisywaniem warstwy sterującej zamiast kolejnym treningiem, koszt wejścia w samopoprawiające się systemy spada z farmy GPU do zwykłego serwera.
Raven przesuwa granicę dalej niż pojedynczy agent: traktuje cudze narzędzia jako wymienne części własnej architektury. To ustawia dostawców modeli w roli podwykonawców warstwy, której nie kontrolują, i przenosi wartość z wag do orkiestracji.
Co dalej?
- Curator pozostaje eksperymentalny i dostępny tylko z repozytorium — przeniesienie go do instalowanego pakietu pokaże, że EverMind uznał mechanizm za stabilny
- Po 0.2.0 z 23 września ukazały się 0.2.1, 0.2.2 i 0.2.3, ta ostatnia 27 września
- Teza raportu, że składanie agentów poszerza zakres zadań ponad możliwości pojedynczych części, czeka na niezależną weryfikację
Źródła
- GitHub — Raven 0.2.0
- GitHub — EverMind-AI/Raven
- GitHub — Raven Technical Report v1
- Jiqizhixin — Claude Code、Codex组队干活,Raven新版本既做总调度,也让Harness持续进化





