Dane
C4
2019AktywnyOpublikowano: 29 września 2026Aktualizacja: 29 września 2026Opublikowany
Colossal Clean Crawled Corpus: przefiltrowana wersja Common Crawl (język angielski) użyta do pretreningu T5.
Kluczowa
innowacja
Ogromny, oczyszczony korpus tekstu z Common Crawl (~750 GB), stworzony na potrzeby modelu T5 — jeden z fundamentów pretreningu nowoczesnych LLM.
Kategoria
Dane
Poziom abstrakcji
Primitive
Poziom operacji
Dane
Zastosowania
Pretraining LLM (T5 i kolejne)Punkt odniesienia dla korpusów tekstowychBadania nad jakością i stronniczością danych webowychBazowy korpus dla wariantów (mC4)
Jak działa
Potok czyszczenia stosuje heurystyki: zachowuje tylko linie kończące się interpunkcją, usuwa strony z listą „brzydkich słów", deduplikuje trzyzdaniowe fragmenty, wykrywa język (angielski), odrzuca kod/placeholdery i zbyt krótkie dokumenty. Wynik udostępniono m.in. przez TensorFlow Datasets, co ułatwia powtarzalny pretraining.
Rozwiązany problem
Surowy Common Crawl jest ogromny, ale pełen śmieci, duplikatów i treści niskiej jakości. C4 dostarcza oczyszczony, powtarzalny korpus do pretreningu na wielką skalę.
Komponenty
Migawka Common CrawlWejście
Surowe źródło stron internetowych.
Heurystyki czyszczeniaPrzetwarzanie
Filtry języka, jakości, deduplikacji i boilerplate’u.
Ewolucja
Oryginalny paper · 2019 · JMLR 2020 · Colin Raffel
Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (T5)
Colin Raffel, Noam Shazeer, Adam Roberts, et al.
2019
C4 wprowadzony wraz z modelem T5
Punkt przełomowy2021
Analizy dokumentacyjne C4 (jakość, stronniczość źródeł)