Organizatorzy udostępniają ustalone korpusy treningowe i definiują ścieżki (tracks) z twardym limitem danych. Uczestnicy pretrenują dowolną architekturę wyłącznie w ramach tego budżetu (z limitem do 10 epok), a następnie zgłaszają model do wspólnego pipeline'u ewaluacyjnego. Główne ścieżki: Strict (100M słów, ustalony zbiór), Strict-Small (10M słów, ustalony zbiór) oraz Loose — ścieżka o tym samym limicie ilości tekstu, ale z dowolnością co do doboru danych, ich domeny, a nawet modalności (co w edycji 2024 wyewoluowało w ścieżkę multimodalną: 100M słów + sparowane dane obraz-tekst). Modele są rankingowane na benchmarkach BLiMP, (Super)GLUE i EWoK.
Współczesne modele językowe wymagają bilionów tokenów i ogromnych zasobów obliczeniowych, co czyni badania nad pretrenowaniem niedostępnymi dla większości laboratoriów i oddala je od sposobu, w jaki ludzie uczą się języka z ograniczonych danych. BabyLM standaryzuje porównywalny, mały budżet danych i wspólną ewaluację, umożliwiając rzetelne badanie efektywności danych.
Pretrenowanie na ustalonym, udostępnionym korpusie o budżecie 100M słów.
Pretrenowanie na ustalonym, udostępnionym korpusie o budżecie 10M słów — najbardziej restrykcyjna ścieżka.
Limit dotyczy tylko ilości tekstu; dowolność w doborze danych, domeny i modalności. W 2024 wyewoluowała w ścieżkę multimodalną (100M słów + sparowane dane obraz-tekst).
Budżet 100M słów tekstu plus sparowane dane obraz-tekst; oceniana m.in. na zadaniach (wizualnego) QA i ugruntowania. W 2024 żadne zgłoszenie nie pokonało baselines.
Wspólny pipeline oceny: BLiMP (wiedza gramatyczna, pary minimalne), (Super)GLUE (rozumienie języka po fine-tuningu) oraz — od 2024 — EWoK (Elements of World Knowledge).
Inauguracja wyzwania na CoNLL 2023 w Singapurze. Ścieżki Strict (100M), Strict-Small (10M) i Loose; ewaluacja m.in. na BLiMP i (Super)GLUE.
Druga edycja na CoNLL 2024 w Miami. Dodano ścieżkę multimodalną (100M słów + obraz) oraz benchmark EWoK. Spośród 31 zgłoszeń najlepszy był hybrydowy model przyczynowo-maskowany GPT-BERT.
Wyzwanie kontynuowane jest jako coroczny warsztat współlokowany z CoNLL/EMNLP, z ewoluującymi ścieżkami i budżetami danych.
Twardy limit danych treningowych: 10M lub 100M słów.
Wybór ścieżki konkursowej: Strict, Strict-Small, Loose lub Multimodal.
Ograniczenie treningu do maksymalnie 10 epok nad budżetem danych.