Robocikowo>ROBOCIKOWO
nanochat

nanochat

d20 (speedrun)
Minimalny, otwartoźródłowy (MIT) framework Andreja Karpathy'ego do trenowania własnego LLM w stylu ChatGPT od zera na jednym węźle GPU — od tokenizera po wnioskowanie.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceLLM
Okno kontekstowe
1024 tokenów
tokenów
Parametry
≈561M (d20)
parametrów
Data premiery
13 października 2025
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud📱 Na urządzeniu

Przegląd

nanochat to minimalny, otwartoźródłowy (licencja MIT) framework treningowy autorstwa Andreja Karpathy'ego, który pozwala wytrenować własny model językowy w stylu ChatGPT „od zera” na pojedynczym węźle GPU. Kod obejmuje wszystkie etapy: trening tokenizera (BPE w stylu GPT-4), pretrening modelu bazowego, dostrajanie nadzorowane (SFT), opcjonalny reinforcement learning oraz wnioskowanie przez interfejs CLI i webowy interfejs czatu.

Repozytorium jest jednocześnie kodem treningowym i przepisem na konkretny model wynikowy. Referencyjny „speedrun” trenuje model d20 (głębokość 20 warstw, ok. 561 mln parametrów, wymiar modelu 1280, 10 głów uwagi, długość kontekstu 1024 tokeny, słownik 65 536 tokenów) na ok. 11,2 mld tokenów w około 4 godziny na węźle 8×H100, za koszt rzędu ok. $100. Model osiąga zdolności porównywalne z GPT-2 (wynik CORE ok. 0,22 dla wersji bazowej).

Złożoność modelu sterowana jest jednym parametrem `--depth`; pozostałe hiperparametry dobierane są automatycznie w sposób compute-optimal. nanochat wykorzystuje architekturę transformera z optymalizatorem AdamW + Muon, silnik wnioskowania z KV-cache oraz wykonywanie kodu Pythona jako narzędzie. Projekt utrzymuje leaderboard „time-to-GPT-2” mierzony metryką DCLM CORE.

Klasyfikacja
LLM
Dostęp i wdrożenie
Pobieranie
LokalnieChmuraNa urządzeniu
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 1024 tokenów
🧩 Parametry: ≈561M (d20)
✓ Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
1024 tokenów
tokenów
Parametry
≈561M (d20)
parametrów
Licencja
MIT
Wymagania sprzętowe
Trening referencyjny: węzeł 8×H100 (≈80 GB VRAM na GPU). Działa też na 8×A100 (wolniej), na pojedynczym GPU (≈8× dłużej) oraz na CPU / Apple Silicon (MPS) w mocno zmniejszonej skali. Domyślna precyzja bfloat16 na GPU SM 80+.
Funkcje:✓ Używanie narzędzi✓ Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language
Naturalna konwersacja
Prowadzenie rozmowy tonu bliskiego ludzkiemu: cieplejszy głos, empatia w odpowiedziach emocjonalnych, humor, unikanie sztywnego 'żargonu asystenta AI'. Wprowadzone jako świadome ulepszenie w GPT-5.1 Instant.
Kategoria: language
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Przestrzeganie instrukcji
Precyzyjne wypełnianie wskazówek zawartych w prompcie: format odpowiedzi, długość, styl, ograniczenia (np. 'odpowiedz w sześciu słowach'). GPT-5.1 znacząco poprawił tę zdolność względem GPT-5.
Kategoria: language

Wyniki benchmarków

7 benchmarków
DCLM CORE
CORE · model bazowy d20
0.2219
📄 Oficjalny post „original nanochat post” (GitHub Discussions #1)
Karta wyników oryginalnego wydania modelu d20 (13.10.2025). Dla porównania: checkpoint GPT-2 = 0,2565.
ARC-Easy
accuracy · model d20 po SFT
0.3876
📄 GitHub Discussions #1
ARC-Challenge
accuracy · model d20 po SFT
0.2807
📄 GitHub Discussions #1
MMLU
accuracy · model d20 po SFT
0.3151
📄 GitHub Discussions #1
GSM8K
accuracy · model d20 po SFT
0.0455
📄 GitHub Discussions #1
HumanEval
pass@1 · model d20 po SFT
0.0854
📄 GitHub Discussions #1
ChatCORE
ChatCORE · model d20 po SFT
0.0884
📄 GitHub Discussions #1

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)