Robocikowo>ROBOCIKOWO
Ocena jakości

BabyLM

2023AktywnyOpublikowano: 25 sierpnia 2026Aktualizacja: 25 sierpnia 2026Opublikowany
Coroczne wyzwanie badawcze (od 2023) polegające na pretrenowaniu modeli językowych na małym, rozwojowo prawdopodobnym budżecie danych (10M i 100M słów).
Kluczowa innowacja
Przeniósł badania nad pretrenowaniem modeli językowych z paradygmatu skalowania danych na sample-efficiency — uczenie z budżetu danych porównywalnego z tym, jaki słyszy dziecko (10M i 100M słów).
Kategoria
Ocena jakości
Poziom abstrakcji
Paradygmat
Poziom operacji
TreningDane
Zastosowania
Sample-efficient pretrainingData-efficient pretrainingCognitively plausible language modelingKognitywne modelowanie akwizycji językaBenchmarking małych modeli językowychDemokratyzacja badań nad pretrenowaniem

Jak działa

Organizatorzy udostępniają ustalone korpusy treningowe i definiują ścieżki (tracks) z twardym limitem danych. Uczestnicy pretrenują dowolną architekturę wyłącznie w ramach tego budżetu (z limitem do 10 epok), a następnie zgłaszają model do wspólnego pipeline'u ewaluacyjnego. Główne ścieżki: Strict (100M słów, ustalony zbiór), Strict-Small (10M słów, ustalony zbiór) oraz Loose — ścieżka o tym samym limicie ilości tekstu, ale z dowolnością co do doboru danych, ich domeny, a nawet modalności (co w edycji 2024 wyewoluowało w ścieżkę multimodalną: 100M słów + sparowane dane obraz-tekst). Modele są rankingowane na benchmarkach BLiMP, (Super)GLUE i EWoK.

Rozwiązany problem

Współczesne modele językowe wymagają bilionów tokenów i ogromnych zasobów obliczeniowych, co czyni badania nad pretrenowaniem niedostępnymi dla większości laboratoriów i oddala je od sposobu, w jaki ludzie uczą się języka z ograniczonych danych. BabyLM standaryzuje porównywalny, mały budżet danych i wspólną ewaluację, umożliwiając rzetelne badanie efektywności danych.

Komponenty

Strict trackŚcieżka konkursowa

Pretrenowanie na ustalonym, udostępnionym korpusie o budżecie 100M słów.

Strict-Small trackŚcieżka konkursowa

Pretrenowanie na ustalonym, udostępnionym korpusie o budżecie 10M słów — najbardziej restrykcyjna ścieżka.

Loose trackŚcieżka konkursowa

Limit dotyczy tylko ilości tekstu; dowolność w doborze danych, domeny i modalności. W 2024 wyewoluowała w ścieżkę multimodalną (100M słów + sparowane dane obraz-tekst).

Multimodal trackŚcieżka konkursowa (od 2024)

Budżet 100M słów tekstu plus sparowane dane obraz-tekst; oceniana m.in. na zadaniach (wizualnego) QA i ugruntowania. W 2024 żadne zgłoszenie nie pokonało baselines.

Evaluation pipelineWspólna ewaluacja

Wspólny pipeline oceny: BLiMP (wiedza gramatyczna, pary minimalne), (Super)GLUE (rozumienie języka po fine-tuningu) oraz — od 2024 — EWoK (Elements of World Knowledge).

Ewolucja

Oryginalny paper · 2023 · CoNLL 2023 · Alex Warstadt
Call for Papers — The BabyLM Challenge: Sample-efficient pretraining on a developmentally plausible corpus
Alex Warstadt, Leshem Choshen, Aaron Mueller, Adina Williams, Ethan Wilcox, Chengxu Zhuang
2023
Pierwsza edycja (CoNLL 2023)
Punkt przełomowy

Inauguracja wyzwania na CoNLL 2023 w Singapurze. Ścieżki Strict (100M), Strict-Small (10M) i Loose; ewaluacja m.in. na BLiMP i (Super)GLUE.

2024
Druga edycja i zwycięstwo GPT-BERT (CoNLL 2024)
Punkt przełomowy

Druga edycja na CoNLL 2024 w Miami. Dodano ścieżkę multimodalną (100M słów + obraz) oraz benchmark EWoK. Spośród 31 zgłoszeń najlepszy był hybrydowy model przyczynowo-maskowany GPT-BERT.

2025
Kontynuacja jako coroczny warsztat

Wyzwanie kontynuowane jest jako coroczny warsztat współlokowany z CoNLL/EMNLP, z ewoluującymi ścieżkami i budżetami danych.

Hiperparametry (konfigurowalne osie)

Budżet słówKrytyczna

Twardy limit danych treningowych: 10M lub 100M słów.

10M wordsŚcieżka Strict-Small
100M wordsŚcieżki Strict, Loose i Multimodal
ŚcieżkaWysoka

Wybór ścieżki konkursowej: Strict, Strict-Small, Loose lub Multimodal.

Liczba epokŚrednia

Ograniczenie treningu do maksymalnie 10 epok nad budżetem danych.

≤ 10 epochsLimit regulaminowy