Google Research i Virginia Tech opisały WikiSkill — framework, w którym agent trzyma wnioski z nieudanych prób w trwałej bazie wiedzy, a nie w prompcie. Praca trafiła na arXiv 27 sierpnia 2026, a szerszą analizę opublikował 1 października VentureBeat. Na największym testowanym modelu zysk sięgnął 23,9 pkt proc. średniej dokładności.
Najważniejsze w skrócie
- Trzy warstwy: Raw (surowe ślady wykonania), Wiki (skonsolidowana wiedza), Skill (instrukcje wykonawcze)
- Pięć benchmarków: LiveMath, SealQA, SpreadSheet, OfficeQA i ALFWorld
- Pięć modeli: Qwen-3.5-4B, Qwen-3.5-9B, Qwen-3.6-27B, Gemma-4-31B i Gemini 3.5 Flash
- Przewaga nad najlepszą konkurencyjną metodą: od 3,3 do 12,0 pkt proc. średniej dokładności
- Qwen-3.5-9B z WikiSkill osiąga 47,4 proc., Qwen-3.6-27B bez umiejętności — 39,4 proc.
Wiki osobno, prompt osobno
Dotychczasowe metody ewolucji umiejętności?Skill evolution: Automatyczne odkrywanie procedur wielokrotnego użytku z zapisu działań agenta i stopniowe ich ulepszanie między kolejnymi przebiegami. gubiły powód porażki: wnioski rozpraszały się po historii optymalizacji, więc agent trafiał na tę samą ścianę raz za razem.
Kluczowy jest podział kosztów. Wiki może rosnąć bez ograniczeń, ale nie trafia do kontekstu przy każdym wywołaniu — agent dostaje tylko skrót proceduralny. Modele Google generują zwięźlejsze skille (45,1 linii dla Gemma-4-31B, 81,2 dla Gemini 3.5 Flash) niż modele Qwen, których skille mają 118,9–128,6 linii.
Większy model, większy zysk
W rodzinie Qwen poprawa rośnie ze skalą. Co ciekawsze, umiejętności potrafią zastąpić parametry — Qwen-3.5-9B z WikiSkill osiąga 47,4 proc. średniej i wyprzedza trzykrotnie większy Qwen3.6-27B bez skilli, który kończy na 39,4 proc.
| Model | vs. najlepsza konkurencyjna metoda | vs. brak umiejętności |
|---|---|---|
| Qwen-3.5-4B | +3,3 pkt | +12,3 pkt |
| Qwen-3.5-9B | +5,1 pkt | +17,5 pkt |
| Qwen-3.6-27B | +10,0 pkt | +23,9 pkt |
| Gemma-4-31B | +5,8 pkt | — |
| Gemini 3.5 Flash | +12,0 pkt | — |
Transfer bywa toksyczny
Skille przenoszą się między rodzinami modeli, czasem lepiej niż własne — Qwen-3.5-9B na ALFWorld osiąga 70,2 proc. z instrukcjami wygenerowanymi przez model 27B wobec 63,4 proc. z własnymi.
Dlaczego to ważne?
Większość wdrożeń agentowych rozwiązuje problem pamięci przez context engineering, czyli dopychanie kontekstu, co kosztuje tokeny i rozmywa uwagę modelu. Rozdzielenie archiwum od instrukcji wykonawczych przenosi ciężar z inferencji na offline'owy etap konsolidacji. Wynik transferu pokazuje przy okazji, że umiejętności są artefaktem wymienialnym — i że mogą zaszkodzić, jeśli pochodzą ze słabszego modelu.
Co dalej?
- Praca nie podaje terminu udostępnienia kodu ani wiki jako gotowego narzędzia
- Negatywny transfer na SpreadSheet pozostaje nierozwiązany i wymaga ręcznego doboru źródła skilla
- Gemini 3.5 Flash osiągnął 100 proc. na walidacji ALFWorld przed ewolucją, więc brak tam punktu odniesienia





