Robocikowo>ROBOCIKOWO
Trening

Uczenie społeczne

AktywnyOpublikowano: 25 sierpnia 2026Aktualizacja: 25 sierpnia 2026Opublikowany
Paradygmat, w którym agent AI uczy się przez obserwację i naśladowanie innych agentów lub ludzi, zamiast wyłącznie z własnego doświadczenia lub surowego korpusu danych.
Kluczowa innowacja
Przeniesienie idei uczenia przez obserwację i naśladownictwo z psychologii do AI: agent zdobywa umiejętności i wiedzę od innych agentów lub ludzi, zamiast wyłącznie z własnego doświadczenia metodą prób i błędów albo ze statycznego korpusu danych.
Kategoria
Trening
Poziom abstrakcji
Paradygmat
Poziom operacji
TreningŚrodowisko agentoweSystem
Zastosowania
Uczenie ze wzmocnieniem wieloagentowe (multi-agent RL)AI ucieleśniona i robotyka: uczenie z demonstracjiTransmisja kulturowa umiejętności między agentamiUczenie przez naśladowanie (imitation learning)Współdzielenie wiedzy między modelami LLM z dbałością o prywatnośćPrzyspieszanie eksploracji i curriculum przez rówieśników

Jak działa

Mechanizm zależy od odmiany. W wieloagentowym RL i robotyce agent-obserwator postrzega zachowanie lub demonstracje innego agenta (eksperta) i aktualizuje własną politykę tak, aby je odtworzyć — przez uczenie z naśladowania, klonowanie zachowań lub nagrody za podążanie za ekspertem; w podejściu transmisji kulturowej dzieje się to w czasie rzeczywistym i few-shot, bez uprzednio zebranych danych ludzkich. W wariancie dla LLM model-nauczyciel koduje wiedzę o zadaniu w formie podpowiedzi w języku naturalnym lub przykładów syntetycznych, które model-uczeń wykorzystuje do nauki zadania, co ogranicza zapamiętywanie surowych danych. We wszystkich odmianach wspólnym rdzeniem jest kanał sygnału społecznego (obserwacja, demonstracja lub komunikat) oraz reguła aktualizacji przenosząca zaobserwowaną kompetencję do ucznia.

Rozwiązany problem

Samodzielne uczenie ze wzmocnieniem jest kosztowne próbkowo — agent musi metodą prób i błędów odkryć dobre zachowania, co bywa powolne i niebezpieczne w realnym świecie. Uczenie społeczne skraca ten proces, pozwalając agentowi przejąć już zdobytą wiedzę od eksperta lub innych agentów. W kontekście LLM rozwiązuje dodatkowo problem transferu wiedzy między modelami bez udostępniania surowych, potencjalnie wrażliwych danych treningowych.

Implementacja

Pułapki implementacyjne
Naśladowanie suboptymalnego ekspertaWysoka

Uczeń kopiuje błędy lub uprzedzenia demonstratora; jakość polityki ucznia jest ograniczona jakością źródła społecznego.

Rozwiązanie:Filtrowanie i ważenie demonstracji według kompetencji eksperta; łączenie z sygnałem nagrody własnej agenta.
Nadmierne naśladowanie (over-imitation)Średnia

Agent odtwarza także nieistotne lub przypadkowe elementy zachowania eksperta zamiast wyłącznie kroków przyczynowo istotnych.

Rozwiązanie:Uczenie cech przyczynowych zadania i mechanizmy odwagowujące naśladowanie w miarę wzrostu kompetencji.
Wyciek prywatności przy transferze wiedzy między modelamiŚrednia

W wariancie dla LLM przykłady syntetyczne lub podpowiedzi mogą nieumyślnie ujawniać surowe dane treningowe nauczyciela.

Rozwiązanie:Kontrola memoryzacji, filtrowanie wygenerowanych treści i preferowanie abstrakcyjnych podpowiedzi nad dosłownymi przykładami.

Ewolucja

Oryginalny paper · 2022 · arXiv (DeepMind) · Cultural General Intelligence Team (DeepMind)
Learning Robust Real-Time Cultural Transmission without Human Data
Cultural General Intelligence Team (DeepMind), Avishkar Bhoopchand, Edward Hughes
1977
Teoria uczenia społecznego Bandury
Punkt przełomowy

Albert Bandura formalizuje uczenie przez obserwację, naśladowanie i modelowanie, w tym wzmocnienie zastępcze — psychologiczna podstawa późniejszych ujęć w AI.

2022
Transmisja kulturowa w RL bez danych ludzkich (DeepMind)
Punkt przełomowy

Zespół Cultural General Intelligence w DeepMind pokazuje agenty uczące się nowych zadań w czasie rzeczywistym przez naśladowanie eksperta, bez wcześniej zebranych danych treningowych.

2023
Social learning dla LLM (Mohtashami i in.)

Zaproponowano framework, w którym modele językowe przekazują sobie wiedzę w języku naturalnym poprzez podpowiedzi lub przykłady syntetyczne, z dbałością o prywatność.