Robocikowo>ROBOCIKOWO
Dane

C4

2019AktywnyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
Colossal Clean Crawled Corpus: przefiltrowana wersja Common Crawl (język angielski) użyta do pretreningu T5.
Kluczowa innowacja
Ogromny, oczyszczony korpus tekstu z Common Crawl (~750 GB), stworzony na potrzeby modelu T5 — jeden z fundamentów pretreningu nowoczesnych LLM.
Kategoria
Dane
Poziom abstrakcji
Primitive
Poziom operacji
Dane
Zastosowania
Pretraining LLM (T5 i kolejne)Punkt odniesienia dla korpusów tekstowychBadania nad jakością i stronniczością danych webowychBazowy korpus dla wariantów (mC4)

Jak działa

Potok czyszczenia stosuje heurystyki: zachowuje tylko linie kończące się interpunkcją, usuwa strony z listą „brzydkich słów", deduplikuje trzyzdaniowe fragmenty, wykrywa język (angielski), odrzuca kod/placeholdery i zbyt krótkie dokumenty. Wynik udostępniono m.in. przez TensorFlow Datasets, co ułatwia powtarzalny pretraining.

Rozwiązany problem

Surowy Common Crawl jest ogromny, ale pełen śmieci, duplikatów i treści niskiej jakości. C4 dostarcza oczyszczony, powtarzalny korpus do pretreningu na wielką skalę.

Komponenty

Migawka Common CrawlWejście

Surowe źródło stron internetowych.

Heurystyki czyszczeniaPrzetwarzanie

Filtry języka, jakości, deduplikacji i boilerplate’u.