
GPT-BERT
Hybrydowy model językowy łączący cel autoregresyjny (GPT) z maskowanym modelowaniem języka (BERT) w jednym transformerze; zwycięska architektura BabyLM Challenge 2024.
🔬 Research✓ Publiczny dostęp⚖ Open sourceLLM
Parametry
119M (base) / 30M (small)
parametrów
Data premiery
31 października 2024
Dostęp:DownloadWdrożenie:💻 Lokalnie
Przegląd
Klasyfikacja
LLM
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 119M (base) / 30M (small)
✓ Fine-tuning
📥 Wejście: tekst
Specyfikacja techniczna
Parametry
119M (base) / 30M (small)
parametrów
Licencja
MIT
Wymagania sprzętowe
Niewielki model (ok. 30M–119M parametrów); trening i inferencja możliwe na pojedynczym GPU.
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
text
Możliwości i zastosowania
Natywne możliwości modelu
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language
Klasyfikacja
Przyporządkowanie obserwacji do jednej z predefiniowanych klas (binarna lub wieloklasowa). Wynik: etykieta klasy oraz opcjonalnie prawdopodobieństwa.
Kategoria: other
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)