Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

WikiSkill: agent zapisuje własne porażki w wiki, nie w prompcie

Pan Robocik10 października 2026 · 2 min czytania
WikiSkill: agent zapisuje własne porażki w wiki, nie w prompcie

Google Research i Virginia Tech opisały WikiSkill — framework, w którym agent trzyma wnioski z nieudanych prób w trwałej bazie wiedzy, a nie w prompcie. Praca trafiła na arXiv 27 sierpnia 2026, a szerszą analizę opublikował 1 października VentureBeat. Na największym testowanym modelu zysk sięgnął 23,9 pkt proc. średniej dokładności.

Najważniejsze w skrócie

  • Trzy warstwy: Raw (surowe ślady wykonania), Wiki (skonsolidowana wiedza), Skill (instrukcje wykonawcze)
  • Pięć benchmarków: LiveMath, SealQA, SpreadSheet, OfficeQA i ALFWorld
  • Pięć modeli: Qwen-3.5-4B, Qwen-3.5-9B, Qwen-3.6-27B, Gemma-4-31B i Gemini 3.5 Flash
  • Przewaga nad najlepszą konkurencyjną metodą: od 3,3 do 12,0 pkt proc. średniej dokładności
  • Qwen-3.5-9B z WikiSkill osiąga 47,4 proc., Qwen-3.6-27B bez umiejętności — 39,4 proc.
+23,9 pkt proc.średniej dokładności na Qwen-3.6-27B wobec pracy bez umiejętnościarXiv 2608.27454

Wiki osobno, prompt osobno

Dotychczasowe metody Skill evolution: Automatyczne odkrywanie procedur wielokrotnego użytku z zapisu działań agenta i stopniowe ich ulepszanie między kolejnymi przebiegami. gubiły powód porażki: wnioski rozpraszały się po historii optymalizacji, więc agent trafiał na tę samą ścianę raz za razem.

Raw
Zapis wykonania zadaniawarstwa Raw, niezmienna
Wiki
Konsolidacja do wikitryby awarii i skuteczne strategie
Skill
Propozycja nowej wersji skillawarstwa Skill
Czy kandydat poprawia wynik na walidacji?
TAK
Nowy aktywny zestaw umiejętnościAllow
NIE
Kandydat odrzuconyDeny
Kolejna iteracja na nowym zadaniuwiki rośnie, skill zostaje zwięzły
Cykl WikiSkill: od śladu wykonania do zaakceptowanej umiejętności

Kluczowy jest podział kosztów. Wiki może rosnąć bez ograniczeń, ale nie trafia do kontekstu przy każdym wywołaniu — agent dostaje tylko skrót proceduralny. Modele Google generują zwięźlejsze skille (45,1 linii dla Gemma-4-31B, 81,2 dla Gemini 3.5 Flash) niż modele Qwen, których skille mają 118,9–128,6 linii.

Większy model, większy zysk

W rodzinie Qwen poprawa rośnie ze skalą. Co ciekawsze, umiejętności potrafią zastąpić parametry — Qwen-3.5-9B z WikiSkill osiąga 47,4 proc. średniej i wyprzedza trzykrotnie większy Qwen3.6-27B bez skilli, który kończy na 39,4 proc.

Modelvs. najlepsza konkurencyjna metodavs. brak umiejętności
Qwen-3.5-4B+3,3 pkt+12,3 pkt
Qwen-3.5-9B+5,1 pkt+17,5 pkt
Qwen-3.6-27B+10,0 pkt+23,9 pkt
Gemma-4-31B+5,8 pkt—
Gemini 3.5 Flash+12,0 pkt—
Średnia dokładność w pięciu benchmarkach. Myślnik oznacza wartość nieraportowaną w pracy.

Transfer bywa toksyczny

Skille przenoszą się między rodzinami modeli, czasem lepiej niż własne — Qwen-3.5-9B na ALFWorld osiąga 70,2 proc. z instrukcjami wygenerowanymi przez model 27B wobec 63,4 proc. z własnymi.

Negatywny transfer. Skille z modelu Qwen-3.5-4B obniżyły wynik Gemini 3.5 Flash na SpreadSheet z 50,5 do 18,1 proc. — kodowały obejścia pod słabszy model i zjadały budżet wywołań narzędzi. Te same skille z modelu 27B podniosły ten wynik do 63,4 proc.

Dlaczego to ważne?

Większość wdrożeń agentowych rozwiązuje problem pamięci przez context engineering, czyli dopychanie kontekstu, co kosztuje tokeny i rozmywa uwagę modelu. Rozdzielenie archiwum od instrukcji wykonawczych przenosi ciężar z inferencji na offline'owy etap konsolidacji. Wynik transferu pokazuje przy okazji, że umiejętności są artefaktem wymienialnym — i że mogą zaszkodzić, jeśli pochodzą ze słabszego modelu.

Co dalej?

  • Praca nie podaje terminu udostępnienia kodu ani wiki jako gotowego narzędzia
  • Negatywny transfer na SpreadSheet pozostaje nierozwiązany i wymaga ręcznego doboru źródła skilla
  • Gemini 3.5 Flash osiągnął 100 proc. na walidacji ALFWorld przed ewolucją, więc brak tam punktu odniesienia

Źródła

Udostępnij ten artykuł