Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Nagroda w LLM mieści się w 1% neuronów. Bez nich model się sypie

Pan Robocik26 września 2026 · 2 min czytania
Nagroda w LLM mieści się w 1% neuronów. Bez nich model się sypie

Guowei Xu z Tsinghua University oraz Mert Yuksekgonul i James Zou ze Stanford University pokazali, że informacja o nagrodzie w dużym modelu językowym skupia się w mniej niż 1% neuronów warstwy. Wyzerowanie tego jednego procenta zbija skuteczność Qwen-2.5-7B na MATH500 z 75,2% do 20,3%, a wyzerowanie tej samej liczby losowych neuronów nie zmienia nic.

Najważniejsze w skrócie

  • Mniej niż 1% neuronów warstwy wystarcza, by przewidzieć wartość stanu
  • Wyzerowanie 1% neuronów wartości: 75,2% → 20,3% na MATH500
  • Wyzerowanie 1% losowych neuronów: 74,6%, czyli spadek o 0,6 pkt proc.
  • Neurony dopaminowe kodują błąd TD — rozbieżność oczekiwań i wyniku
  • Jako process reward model podnoszą wynik z 72,2% do 77,8%
−54,9 pkt proc.średni spadek skuteczności na MATH500 po wyzerowaniu 1% neuronów wartości w jednej warstwiearXiv:2602.00986 v2, tab. 2

Dwa rodzaje neuronów, jedna analogia

Autorzy trenują prostą dwuwarstwową sondę na stanach ukrytych i stopniowo przycinają jej wejścia. AUC nie spada — sonda radzi sobie na garstce neuronów. Nazwano je neuronami wartości, bo przewidują, czy model rozwiąże zadanie, zanim napisze choć słowo odpowiedzi.

Drugi zbiór, neurony dopaminowe, znaleziono tam, gdzie przewidywanie rozmija się z wynikiem: ich aktywacja skacze, gdy model niespodziewanie robi postęp, i zapada się w momencie błędu.

…
Standardowa definicja błędu TD. Aktywacja neuronów dopaminowych rośnie, gdy δ jest dodatnie, i spada, gdy ujemne.
Znaczenie symboli
…
błąd TD — różnica między tym, czego model oczekiwał, a tym, co dostał
…
nagroda otrzymana w kroku t
…
przewidywana wartość stanu przed krokiem
…
współczynnik dyskontowania przyszłych nagród

Kontrole, które oddzielają ważne od nagrodowych

Sam spadek po ablacji niczego nie dowodzi — wyzerowanie dowolnych istotnych neuronów też szkodzi. Zespół porównał więc cztery inne kryteria wyboru.

Kryterium wyboru 1% neuronówŚrednia skuteczność
Neurony wartości20,3%
Wanda65,8%
Magnitude71,6%
Losowe74,6%
Neurony NTP (przewidywanie następnego tokena)76,4%
Skuteczność Qwen-2.5-7B-SimpleRL-Zoo na MATH500 po wyzerowaniu 1% neuronów jednej warstwy, średnia z warstw 2–5. Bez ingerencji: 75,2%.

Neurony wartości i neurony NTP pokrywają się w 0,7% przy losowej bazie 0,5%. Obraz powtarza się na GSM8K, Minerva Math, ARC i MMLU STEM oraz w architekturach Llama, Gemma i Phi.

Od obserwacji do narzędzia

Odczyt z neuronów wartości przewiduje pewność modelu przed generacją lepiej niż sonda na pełnym stanie ukrytym — średnie AUC 0,67 wobec 0,60 — i wyraźnie lepiej niż pytanie modelu wprost (0,52). Neurony dopaminowe posłużyły jako process reward model przy wyborze spośród czterech kandydatów na każdy akapit rozumowania: 77,8% wobec 75,0% dla implicit PRM i 72,2% dla dekodowania zachłannego.

Dlaczego to ważne?

Modele nagrody trenuje się dziś osobno, często w rozmiarze porównywalnym z modelem ocenianym. Jeśli sygnał nagrody siedzi już w setce neuronów w trzeciej warstwie, część tej pracy jest duplikatem. Praktyczna konsekwencja jest prostsza niż sama interpretowalność: tani odczyt pewności przed generacją pozwala przydzielać budżet obliczeniowy zadaniom, które faktycznie go potrzebują.

Co dalej?

  • Wyniki pochodzą z modeli do 14 mld parametrów — nie sprawdzono, czy obraz utrzymuje się wyżej
  • Druga wersja pracy z 11 maja dokłada kontrole magnitude, Wanda i NTP, których nie było w zgłoszeniu z lutego

Źródła

Udostępnij ten artykuł