Robocikowo>ROBOCIKOWO
GPT-BERT

GPT-BERT

Hybrydowy model językowy łączący cel autoregresyjny (GPT) z maskowanym modelowaniem języka (BERT) w jednym transformerze; zwycięska architektura BabyLM Challenge 2024.
🔬 Research✓ Publiczny dostęp⚖ Open sourceLLM
Parametry
119M (base) / 30M (small)
parametrów
Data premiery
31 października 2024
Dostęp:DownloadWdrożenie:💻 Lokalnie

Przegląd

GPT-BERT to hybrydowy model językowy opracowany przez Language Technology Group na Uniwersytecie w Oslo. Łączy dwa paradygmaty uczenia w jednym stosie transformera: przyczynowe modelowanie języka (causal LM, jak w GPT) oraz maskowane modelowanie języka (masked LM, jak w BERT). Dzięki temu ten sam model może działać zarówno jako model autoregresyjny (generujący), jak i jako model maskowany (rozumiejący i klasyfikujący).

Model przedstawiono w pracy „GPT or BERT: why not both?" (Charpentier i Samuel, 2024). W konkursie BabyLM Challenge 2024 — spośród 31 zgłoszeń — hybrydowa architektura przyczynowo-maskowana przewyższyła podejścia oparte wyłącznie na masked LM lub wyłącznie na causal LM. Zgłoszenie trenowano w dwóch ścieżkach: Strict (100M słów, wariant ok. 119M parametrów) oraz Strict-Small (10M słów, wariant ok. 30M parametrów).

Oba warianty to transformery 12-warstwowe (wymiar ukryty 768 dla wariantu base, 384 dla small). Modele trenowano na mieszance korpusów w proporcji 1:1:1 (BabyLM, FineWeb-Edu i Cosmopedia) z tokenizatorem BPE. Kod udostępniono na licencji MIT w repozytorium ltgoslo/gpt-bert, a wagi na platformie Hugging Face.

Klasyfikacja
LLM
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 119M (base) / 30M (small)
✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Parametry
119M (base) / 30M (small)
parametrów
Licencja
MIT
Wymagania sprzętowe
Niewielki model (ok. 30M–119M parametrów); trening i inferencja możliwe na pojedynczym GPU.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
text

Możliwości i zastosowania

Natywne możliwości modelu
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language
Klasyfikacja
Przyporządkowanie obserwacji do jednej z predefiniowanych klas (binarna lub wieloklasowa). Wynik: etykieta klasy oraz opcjonalnie prawdopodobieństwa.
Kategoria: other

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)