Robocikowo>ROBOCIKOWO
GPT-3

GPT-3

175B (davinci) · Rodzina: GPT
Model językowy OpenAI z 175 mld parametrów (2020), który spopularyzował uczenie few-shot w kontekście — bez dostrajania wag.
⚠ Deprecated✓ Publiczny dostępLLM📁 GPT
Okno kontekstowe
2048 tokenów
tokenów
Parametry
175B
parametrów
Max output
2048
tokenów
Data premiery
28 maja 2020
Dostęp:APIHostedWdrożenie:☁ Cloud

Przegląd

GPT-3 (Generative Pre-trained Transformer 3) to autoregresywny model językowy OpenAI zaprezentowany w maju 2020 w pracy „Language Models are Few-Shot Learners” (Brown i in.). Największy wariant liczy 175 miliardów parametrów — dziesięciokrotnie więcej niż jakikolwiek wcześniejszy gęsty model językowy.

Kluczowym wnioskiem pracy było to, że samo skalowanie modelu radykalnie poprawia uczenie „w locie”: GPT-3 wykonuje nowe zadania wyłącznie na podstawie instrukcji i kilku przykładów podanych w prompcie (few-shot / in-context learning), bez żadnych aktualizacji gradientów ani dostrajania wag.

Architektura to dekoder Transformera (96 warstw w wariancie 175B) z oknem kontekstu 2048 tokenów, trenowany metodą samonadzorowaną na ok. 300 mld tokenów z Common Crawl, WebText2, korpusów książkowych i Wikipedii. Wagi są zamknięte (closed weights), a model był udostępniany wyłącznie przez API OpenAI.

GPT-3 spopularyzował paradygmat „prompting zamiast fine-tuningu” i stał się fundamentem produktów takich jak ChatGPT oraz późniejszych rodzin GPT-3.5 i GPT-4. Oryginalne modele completions (davinci, curie, babbage, ada) zostały przez OpenAI wycofane (deprecated).

Klasyfikacja
LLM
Rodzina: GPT
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: 2048 tokenów
🧩 Parametry: 175B
✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
2048 tokenów
tokenów
Parametry
175B
parametrów
Max output tokens
2048
tokenów na odpowiedź
Licencja
Proprietary (OpenAI API)
Wymagania sprzętowe
Trening: ok. 3,14×10^23 FLOP na klastrze GPU (V100) w Microsoft Azure. Model w precyzji 16-bit zajmuje ~350 GB. Wagi zamknięte — inferencja wyłącznie przez API OpenAI (chmura).
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
text

Możliwości i zastosowania

Natywne możliwości modelu
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other
Uczenie few-shot
Zdolność modelu do wykonania nowego zadania na podstawie kilku przykładów podanych bezpośrednio w prompcie, bez aktualizacji wag ani dostrajania.
Kategoria: other

Wyniki benchmarków

6 benchmarków
LAMBADA
accuracy · few-shot (64-shot)
86.4%
📅 28 maj 2020📄 paper
Wynik raportowany w pracy „Language Models are Few-Shot Learners” (GPT-3 175B).
HellaSwag
accuracy · few-shot
79.3%
📅 28 maj 2020📄 paper
Wynik raportowany w pracy „Language Models are Few-Shot Learners” (GPT-3 175B).
TriviaQA
accuracy · few-shot
71.2%
📅 28 maj 2020📄 paper
Wynik raportowany w pracy „Language Models are Few-Shot Learners” (GPT-3 175B).
WinoGrande
accuracy · few-shot
77.7%
📅 28 maj 2020📄 paper
Wynik raportowany w pracy „Language Models are Few-Shot Learners” (GPT-3 175B).
PIQA
accuracy · few-shot
82.8%
📅 28 maj 2020📄 paper
Wynik raportowany w pracy „Language Models are Few-Shot Learners” (GPT-3 175B).
ARC-Challenge
accuracy · few-shot
51.5%
📅 28 maj 2020📄 paper
Wynik raportowany w pracy „Language Models are Few-Shot Learners” (GPT-3 175B).

Cennik

Architektura techniczna

Rdzeń architektury (Core Architecture)
Techniki trenowania (Training Techniques)