Robocikowo>ROBOCIKOWO
Llama 3 8B

Llama 3 8B

8B · Rodzina: Llama 3
Bazowy (pretrained) model językowy Meta o 8 mld parametrów z rodziny Llama 3, wydany w 2024 r. Nie jest dostrojony instrukcyjnie.
✓ Aktywny✓ Publiczny dostęp⚖ Open weightsLLM📁 Llama 3
Okno kontekstowe
8K
tokenów
Parametry
8B
parametrów
Data premiery
18 kwietnia 2024
Dostęp:DownloadAPIWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Llama 3 8B (Meta-Llama-3-8B) to bazowy, wstępnie wytrenowany (pretrained) model językowy o 8 mld parametrów z rodziny Llama 3 firmy Meta, udostępniony 18 kwietnia 2024 r. Jest to wariant bazowy, a nie dostrojony instrukcyjnie (Instruct) — nie przeszedł dostrajania pod instrukcje ani RLHF.

Model wykorzystuje zoptymalizowaną, autoregresyjną architekturę transformera typu decoder-only z mechanizmem grouped-query attention (GQA) oraz tokenizer o słowniku 128 tys. tokenów. Został wstępnie wytrenowany na ponad 15 bln tokenów publicznie dostępnych danych, z granicą wiedzy ustaloną na marzec 2023 r. Długość kontekstu wynosi 8192 tokeny (8K).

Model przyjmuje dane tekstowe i generuje tekst oraz kod. Meta wskazuje zastosowania komercyjne i badawcze w języku angielskim. Wagi udostępniono do pobrania na licencji Meta Llama 3 Community License.

Klasyfikacja
LLM
Rodzina: Llama 3
Dostęp i wdrożenie
PobieranieAPI
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
📏 Kontekst: 8K
🧩 Parametry: 8B
✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
8K
tokenów
Parametry
8B
parametrów
Knowledge cutoff
1 mar 2023
Data graniczna wiedzy
Licencja
Meta Llama 3 Community License
Wymagania sprzętowe
Model 8B mieści się na pojedynczym GPU konsumenckim/serwerowym; w precyzji BF16 wymaga ok. 16 GB pamięci, mniej po kwantyzacji.
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding

Wyniki benchmarków

4 benchmarki
MMLU
accuracy · 5-shot
66.6%
📅 18 kwi 2024📄 Hugging Face model card
ARC-Challenge
accuracy
78.6%
📅 18 kwi 2024📄 Hugging Face model card
CommonSenseQA
accuracy
72.6%
📅 18 kwi 2024📄 Hugging Face model card
SQuAD
76.4%
📅 18 kwi 2024📄 Hugging Face model card

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)