Autoregresyjny model językowy OpenAI (do 1,5 mld parametrów), architektura Transformer decoder-only, trenowany na zbiorze WebText.
Okno kontekstowe
1024 tokenów
tokenów
Parametry
1,5 mld (największa wersja); warianty 124M, 355M, 774M, 1,5B
parametrów
Data premiery
14 lutego 2019
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 1024 tokenów
🧩 Parametry: 1,5 mld (największa wersja); warianty 124M, 355M, 774M, 1,5B
✓ Fine-tuning
📥 Wejście: tekst
Specyfikacja techniczna
Okno kontekstowe
1024 tokenów
tokenów
Parametry
1,5 mld (największa wersja); warianty 124M, 355M, 774M, 1,5B
parametrów
Knowledge cutoff
1 gru 2017
Data graniczna wiedzy
Licencja
Modified MIT
Wymagania sprzętowe
Warianty od 124M do 1,5B parametrów; największy model (1,5B) uruchamialny na pojedynczym GPU.
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
text
Możliwości i zastosowania
Natywne możliwości modelu
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other
Wyniki benchmarków
6 benchmarków
LAMBADA
accuracy · zero-shot
63.24%
📄 paper
Model 1542M, bez treningu i fine-tuningu (Tabela 3).
LAMBADA
perplexity · zero-shot
8.63
📄 paper
Model 1542M (Tabela 3).
WikiText-103
perplexity · zero-shot
17.48
📄 paper
Model 1542M (Tabela 3).
WikiText-2
perplexity · zero-shot
18.34
📄 paper
Model 1542M (Tabela 3).
Penn Treebank
perplexity · zero-shot
35.76
📄 paper
Model 1542M (Tabela 3).
CBT-NE
accuracy · zero-shot
89.05%
📄 paper
Model 1542M (Tabela 3).
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)
