Robocikowo>ROBOCIKOWO
GPT-2

GPT-2

1.5B (1542M) · Rodzina: GPT
Autoregresyjny model językowy OpenAI (do 1,5 mld parametrów), architektura Transformer decoder-only, trenowany na zbiorze WebText.
📦 Zarchiwizowany✓ Publiczny dostęp⚖ Open sourceLLM📁 GPT
Okno kontekstowe
1024 tokenów
tokenów
Parametry
1,5 mld (największa wersja); warianty 124M, 355M, 774M, 1,5B
parametrów
Data premiery
14 lutego 2019
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

GPT-2 (Generative Pre-trained Transformer 2) to autoregresyjny model językowy opracowany przez OpenAI, ogłoszony 14 lutego 2019 roku. Największy wariant liczy około 1,5 miliarda parametrów; wydano też mniejsze warianty o 124M, 355M i 774M parametrów. Model wykorzystuje architekturę Transformer typu decoder-only (największa wersja: 48 warstw, wymiar ukryty 1600) z długością kontekstu 1024 tokenów i słownikiem 50 257 tokenów kodowanych metodą byte-level BPE.

GPT-2 wytrenowano na zbiorze WebText - około 40 GB tekstu z 8 milionów stron internetowych linkowanych z Reddita (posty z co najmniej 3 karma sprzed grudnia 2017). Model uczono metodą samonadzorowanego przewidywania kolejnego tokenu (causal language modeling), bez fine-tuningu pod konkretne zadania. W publikacji „Language Models are Unsupervised Multitask Learners" pokazano, że w trybie zero-shot GPT-2 osiąga stan sztuki na 7 z 8 testowanych zbiorów modelowania języka.

OpenAI zastosowało strategię stopniowego udostępniania (staged release) ze względu na obawy o nadużycia: początkowo opublikowano tylko najmniejszy model, model 774M udostępniono 20 sierpnia 2019, a pełne wagi wariantu 1,5B wydano 5 listopada 2019 na licencji Modified MIT.

Klasyfikacja
LLM
Rodzina: GPT
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 1024 tokenów
🧩 Parametry: 1,5 mld (największa wersja); warianty 124M, 355M, 774M, 1,5B
✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
1024 tokenów
tokenów
Parametry
1,5 mld (największa wersja); warianty 124M, 355M, 774M, 1,5B
parametrów
Knowledge cutoff
1 gru 2017
Data graniczna wiedzy
Licencja
Modified MIT
Wymagania sprzętowe
Warianty od 124M do 1,5B parametrów; największy model (1,5B) uruchamialny na pojedynczym GPU.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
text

Możliwości i zastosowania

Natywne możliwości modelu
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other

Wyniki benchmarków

6 benchmarków
LAMBADA
accuracy · zero-shot
63.24%
📄 paper
Model 1542M, bez treningu i fine-tuningu (Tabela 3).
LAMBADA
perplexity · zero-shot
8.63
📄 paper
Model 1542M (Tabela 3).
WikiText-103
perplexity · zero-shot
17.48
📄 paper
Model 1542M (Tabela 3).
WikiText-2
perplexity · zero-shot
18.34
📄 paper
Model 1542M (Tabela 3).
Penn Treebank
perplexity · zero-shot
35.76
📄 paper
Model 1542M (Tabela 3).
CBT-NE
accuracy · zero-shot
89.05%
📄 paper
Model 1542M (Tabela 3).

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)