Robocikowo>ROBOCIKOWO
Trening

Model Collapse

2024AktywnyAktualizacja: 19 sierpnia 2026Opublikowany
Degeneracyjny proces, w którym modele trenowane na danych wygenerowanych przez inne modele stopniowo tracą informację o rzadkich zdarzeniach (ogonach rozkładu) i pogarszają się z każdą generacją.
Kluczowa innowacja
Zidentyfikowanie i formalny opis degeneracji modeli generatywnych trenowanych rekurencyjnie na danych generowanych przez wcześniejsze modele — z utratą ogonów rozkładu i zbieżnością do zubożonych wyników.
Kategoria
Trening
Poziom abstrakcji
Wzorzec
Poziom operacji
TreningDane
Zastosowania
Ocena ryzyka trenowania na danych generowanych przez AIProjektowanie strategii kuracji danych (mieszanie z danymi ludzkimi)Uzasadnienie znakowania pochodzenia danych (provenance)Badania nad jakością i różnorodnością danych treningowych

Jak działa

Gdy model jest trenowany na próbkach wygenerowanych przez poprzedni model (a nie na oryginalnych danych), błędy się kumulują: skończone próbkowanie pomija rzadkie zdarzenia, model aproksymuje rozkład niedokładnie, a proces uczenia dodaje własne błędy. W efekcie każda kolejna generacja coraz mocniej „obcina” ogony rozkładu i zawęża różnorodność wyjść, aż model traci zdolność reprezentowania oryginalnej różnorodności danych. Zjawisko obserwowano dla LLM, VAE i modeli mieszanin Gaussa.

Rozwiązany problem

Wskazuje ukryte ryzyko trenowania modeli na danych syntetycznych/generowanych przez AI i wyjaśnia, dlaczego jakość może się pogarszać między generacjami — pozwalając projektować strategie ochrony (dane ludzkie, provenance, mieszanie danych).

Kluczowe mechanizmy

Rekurencyjny trening na danych z poprzednich modeli
Kumulacja błędów: próbkowania, aproksymacji, uczenia
Utrata ogonów rozkładu (wczesny kolaps)
Zbieżność do rozkładu o niskiej wariancji (późny kolaps)

Mocne strony i ograniczenia

Mocne strony
✓Wyjaśnia mierzalny mechanizm degradacji
✓Dotyczy wielu klas modeli generatywnych (LLM, VAE, GMM)
✓Motywuje ochronę i kurację danych
Ograniczenia
✗To zjawisko/ryzyko, nie metoda — wymaga strategii łagodzących
✗Skala efektu zależy od udziału danych syntetycznych i procedury
✗Można go częściowo unikać przez mieszanie z danymi rzeczywistymi

Komponenty

Błąd próbkowania statystycznegoŹródło degradacji

Skończone próbki pomijają rzadkie zdarzenia z ogonów rozkładu.

Błąd aproksymacji funkcjiŹródło degradacji

Model nie odwzorowuje rozkładu dokładnie.

Błąd uczeniaŹródło degradacji

Procedura optymalizacji wprowadza dodatkowe odchylenia.

Implementacja

Pułapki implementacyjne
Niewidoczny dryf jakościWysoka

Kolaps może narastać powoli i umykać pobieżnej ewaluacji.

Rozwiązanie:Monitoruj różnorodność/ogony rozkładu, nie tylko średnie metryki.
Zanieczyszczenie danych treningowychWysoka

Dane z internetu zawierają coraz więcej treści generowanych przez AI.

Rozwiązanie:Provenance danych, filtrowanie, udział danych ludzkich.

Ewolucja

Oryginalny paper · 2024 · Nature (2024) · Ilia Shumailov
AI models collapse when trained on recursively generated data
Ilia Shumailov, Zakhar Shumaylov, Yiren Zhao, Nicolas Papernot, Ross Anderson, Yarin Gal
2023
Wczesne prace o „recursion” i danych syntetycznych

Badania sygnalizują ryzyko trenowania na wyjściach modeli.

2024
Publikacja w Nature (Shumailov i in.)
Punkt przełomowy

Formalny opis i nazwa „model collapse”; wczesny vs późny kolaps.

Hiperparametry (konfigurowalne osie)

Udział danych syntetycznychKrytyczna
wysokiWięcej danych z modeli → szybszy kolaps.
z domieszką danych realnychMieszanie z danymi ludzkimi spowalnia kolaps.
Liczba generacjiWysoka
wiele iteracjiEfekt kumuluje się z każdą generacją.