Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Raven 0.2.0: EverMind orkiestruje Claude Code i Codex

Pan Robocik2 października 2026 · 3 min czytania
Raven 0.2.0: EverMind orkiestruje Claude Code i Codex

EverMind AI udostępniło 23 września Ravena 0.2.0 — otwartoźródłowy framework, który sam siebie nazywa „harnessem harnessów”. Jego teza: agent poprawia się bez ruszania wag modelu, jeśli pozwolić mu przepisywać własną warstwę sterującą. Cztery dni później doszedł 82-stronicowy raport techniczny.

Najważniejsze w skrócie

  • Raven 0.2.0 wydany 23 września 2026 na licencji Apache-2.0
  • Pętla agenta rozbita na cztery moduły — Memory, Planning, Capability, Action — przepisywane przez Curatora
  • 13 gotowych presetów agentów zewnętrznych, m.in. Claude Code, Codex i GitHub Copilot
  • Raven RSI: 172 przebiegi treningowe w 7 rundach bez awarii, val_bpb niższy o 5,8%

Samopoprawa w warstwie sterującej

Raven rozbija pętlę agenta na cztery moduły strategii. Nad nimi siedzi Curator: Eksperymentalny moduł Ravena, który przepisuje cztery moduły strategii agenta — raz jako ustawienie, raz jako mały kawałek kodu oceniającego. i przepisuje te cztery miejsca: raz jako ustawienie, raz jako mały kawałek kodu oceniającego.

Moduł strategiiCo obejmuje
MemoryCo tura widzi
PlanningJak agent podchodzi do pracy
CapabilityJakie narzędzia są udostępnione
ActionWybór następnego ruchu i ocena przed wykonaniem
Cztery moduły pętli agenta Ravena, które przepisuje Curator.

Bezpieczniki są dwa. Nic nie trafia do agenta bez weryfikacji, a sygnały z rundy docierają z wyciętą odpowiedzią wzorcową. Curator jest eksperymentalny i jedzie z repozytorium, nie z instalowanym pakietem.

Trzynastu agentów pod jednym dyrygentem

Druga połowa pomysłu to orkiestracja. Raven działa jako Host Agent: rozbija cel na podzadania, dobiera agentów, pilnuje zależności i skleja wyniki.

Czterech ma własnych — Raven-Research, Raven-Code, Raven-Design i Raven-Oncall — a resztę podłącza przez ACP: Agent Client Protocol — otwarty protokół JSON-RPC, przez który program-host lub edytor rozmawia z zewnętrznym agentem kodującym. Nie mylić z Agent Communication Protocol o tym samym skrócie., CLI albo API zgodne z OpenAI. Presetów jest trzynaście, z Claude Code i Codeksem na czele.

Orkiestracja
Cel od człowieka → Host Agentrozbicie na podzadania
Dobór agentów: Claude Code, Codex, Raven-CodeACP, CLI albo API zgodne z OpenAI
Wykonanie podzadań i sklejenie wyników
Samopoprawa
Curator przepisuje Memory, Planning, Capability, Action
Zmiana przechodzi weryfikację?
TAK
Instalacja w harnessie agentaAllow
NIE
Odrzucenie, powrót do CuratoraDeny
Samopoprawa
Kolejna runda na poprawionym harnessieAllow
Pętla „harnessu harnessów”: Host Agent orkiestruje agentów, Curator przepisuje warstwę sterującą.

Liczby z własnej ławki

Najmocniejszą demonstracją jest Raven RSI: system dostał zadanie i kryteria oceny, których nie mógł zmieniać, po czym sam planował rundy, pisał kod i uruchamiał eksperymenty. Przy pretreningu nanochat zszedł o 5,8% z val_bpb w 172 przebiegach, bez ani jednej awarii.

−5,8%val_bpb w 172 przebiegach pretreningu nanochat, bez ani jednej awariiEverMind AI

Tę samą tezę testuje DarwinX od Salesforce, który podniósł skuteczność agenta z 43,5% do 93% na WebArena-Infinity. Różnica leży w zakresie: DarwinX szlifuje harness jednego agenta, Raven robi to na zespole obcych narzędzi. Wyniki pochodzą z materiałów samego EverMind, a projekt jest pre-alpha.

Dlaczego to ważne?

Jeśli postęp da się kupić przepisywaniem warstwy sterującej zamiast kolejnym treningiem, koszt wejścia w samopoprawiające się systemy spada z farmy GPU do zwykłego serwera.

Raven przesuwa granicę dalej niż pojedynczy agent: traktuje cudze narzędzia jako wymienne części własnej architektury. To ustawia dostawców modeli w roli podwykonawców warstwy, której nie kontrolują, i przenosi wartość z wag do orkiestracji.

Co dalej?

  • Curator pozostaje eksperymentalny i dostępny tylko z repozytorium — przeniesienie go do instalowanego pakietu pokaże, że EverMind uznał mechanizm za stabilny
  • Po 0.2.0 z 23 września ukazały się 0.2.1, 0.2.2 i 0.2.3, ta ostatnia 27 września
  • Teza raportu, że składanie agentów poszerza zakres zadań ponad możliwości pojedynczych części, czeka na niezależną weryfikację

Źródła

Udostępnij ten artykuł