Guowei Xu z Tsinghua University oraz Mert Yuksekgonul i James Zou ze Stanford University pokazali, że informacja o nagrodzie w dużym modelu językowym skupia się w mniej niż 1% neuronów warstwy. Wyzerowanie tego jednego procenta zbija skuteczność Qwen-2.5-7B na MATH500 z 75,2% do 20,3%, a wyzerowanie tej samej liczby losowych neuronów nie zmienia nic.
Najważniejsze w skrócie
- Mniej niż 1% neuronów warstwy wystarcza, by przewidzieć wartość stanu
- Wyzerowanie 1% neuronów wartości: 75,2% → 20,3% na MATH500
- Wyzerowanie 1% losowych neuronów: 74,6%, czyli spadek o 0,6 pkt proc.
- Neurony dopaminowe kodują błąd TD — rozbieżność oczekiwań i wyniku
- Jako process reward model podnoszą wynik z 72,2% do 77,8%
Dwa rodzaje neuronów, jedna analogia
Autorzy trenują prostą dwuwarstwową sondę na stanach ukrytych i stopniowo przycinają jej wejścia. AUC nie spada — sonda radzi sobie na garstce neuronów. Nazwano je neuronami wartości, bo przewidują, czy model rozwiąże zadanie, zanim napisze choć słowo odpowiedzi.
Drugi zbiór, neurony dopaminowe, znaleziono tam, gdzie przewidywanie rozmija się z wynikiem: ich aktywacja skacze, gdy model niespodziewanie robi postęp, i zapada się w momencie błędu.
Znaczenie symboli
- …
- błąd TD — różnica między tym, czego model oczekiwał, a tym, co dostał
- …
- nagroda otrzymana w kroku t
- …
- przewidywana wartość stanu przed krokiem
- …
- współczynnik dyskontowania przyszłych nagród
Kontrole, które oddzielają ważne od nagrodowych
Sam spadek po ablacji niczego nie dowodzi — wyzerowanie dowolnych istotnych neuronów też szkodzi. Zespół porównał więc cztery inne kryteria wyboru.
| Kryterium wyboru 1% neuronów | Średnia skuteczność |
|---|---|
| Neurony wartości | 20,3% |
| Wanda | 65,8% |
| Magnitude | 71,6% |
| Losowe | 74,6% |
| Neurony NTP (przewidywanie następnego tokena) | 76,4% |
Neurony wartości i neurony NTP pokrywają się w 0,7% przy losowej bazie 0,5%. Obraz powtarza się na GSM8K, Minerva Math, ARC i MMLU STEM oraz w architekturach Llama, Gemma i Phi.
Od obserwacji do narzędzia
Odczyt z neuronów wartości przewiduje pewność modelu przed generacją lepiej niż sonda na pełnym stanie ukrytym — średnie AUC 0,67 wobec 0,60 — i wyraźnie lepiej niż pytanie modelu wprost (0,52). Neurony dopaminowe posłużyły jako process reward model przy wyborze spośród czterech kandydatów na każdy akapit rozumowania: 77,8% wobec 75,0% dla implicit PRM i 72,2% dla dekodowania zachłannego.
Dlaczego to ważne?
Modele nagrody trenuje się dziś osobno, często w rozmiarze porównywalnym z modelem ocenianym. Jeśli sygnał nagrody siedzi już w setce neuronów w trzeciej warstwie, część tej pracy jest duplikatem. Praktyczna konsekwencja jest prostsza niż sama interpretowalność: tani odczyt pewności przed generacją pozwala przydzielać budżet obliczeniowy zadaniom, które faktycznie go potrzebują.
Co dalej?
- Wyniki pochodzą z modeli do 14 mld parametrów — nie sprawdzono, czy obraz utrzymuje się wyżej
- Druga wersja pracy z 11 maja dokłada kontrole magnitude, Wanda i NTP, których nie było w zgłoszeniu z lutego
Źródła
- arXiv — Sparse Reward Subsystem in Large Language Models
- Hugging Face — Qwen-2.5-7B-SimpleRL-Zoo





