Robocikowo>ROBOCIKOWO
Mistral 7B Instruct

Mistral 7B Instruct

Mistral-7B-Instruct-v0.3 (7.3B) · Rodzina: Mistral
Otwarty (Apache 2.0) instruowany model językowy Mistral AI o 7,3 mld parametrów; okno kontekstu 32k, tokenizer v3 i function calling (v0.3).
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceLLMModel używający narzędzi📁 Mistral
Okno kontekstowe
32K
tokenów
Parametry
7.3B
parametrów
Data premiery
27 września 2023
Dostęp:DownloadAPIWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Mistral 7B Instruct to instruowany wariant otwartego modelu językowego Mistral 7B opracowanego przez francuską firmę Mistral AI. Model bazowy ma 7,3 mld parametrów i wykorzystuje architekturę Transformer z Grouped-Query Attention (GQA) dla szybszej inferencji oraz — w oryginalnej wersji 0.1 — Sliding Window Attention (SWA) z oknem 4096.

W wersjach 0.2 i 0.3 Sliding Window Attention zostało wyłączone, a okno kontekstu rozszerzono do 32 768 tokenów (rope-theta = 1e6). Wersja 0.3 dodatkowo rozszerza słownik do 32 768 tokenów, wprowadza tokenizer v3 oraz obsługę wywoływania funkcji (function calling).

Model jest udostępniany na licencji Apache 2.0 — z otwartymi wagami do pobrania (Hugging Face) oraz przez API Mistral (la Plateforme).

Klasyfikacja
LLMModel używający narzędzi
Rodzina: Mistral
Dostęp i wdrożenie
PobieranieAPI
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 32K
🧩 Parametry: 7.3B
✓ Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
32K
tokenów
Parametry
7.3B
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Otwarte wagi (Apache 2.0) na Hugging Face. Dzięki rozmiarowi 7,3 mld parametrów model działa lokalnie na pojedynczym GPU klasy konsumenckiej (po kwantyzacji nawet ~8 GB VRAM). Dostępny też przez API Mistral (la Plateforme).
Funkcje:✓ Używanie narzędzi✓ Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode

Wyniki benchmarków

8 benchmarków
MMLU
accuracy · model bazowy Mistral 7B, 5-shot
60.1%
📄 Jiang et al., Mistral 7B (arXiv:2310.06825)
Wynik bazowego modelu Mistral 7B z oficjalnego paperu; wariant Instruct dziedziczy tę bazę.
HellaSwag
accuracy · model bazowy Mistral 7B
81.3%
📄 Jiang et al., Mistral 7B (arXiv:2310.06825)
Wynik bazowego modelu Mistral 7B z oficjalnego paperu.
WinoGrande
accuracy · model bazowy Mistral 7B
75.3%
📄 Jiang et al., Mistral 7B (arXiv:2310.06825)
Wynik bazowego modelu Mistral 7B z oficjalnego paperu.
ARC-Challenge
accuracy · model bazowy Mistral 7B
55.5%
📄 Jiang et al., Mistral 7B (arXiv:2310.06825)
Wynik bazowego modelu Mistral 7B z oficjalnego paperu.
HumanEval
pass@1 · model bazowy Mistral 7B
30.5%
📄 Jiang et al., Mistral 7B (arXiv:2310.06825)
Wynik bazowego modelu Mistral 7B z oficjalnego paperu.
MBPP
pass@1 · model bazowy Mistral 7B
47.5%
📄 Jiang et al., Mistral 7B (arXiv:2310.06825)
Wynik bazowego modelu Mistral 7B z oficjalnego paperu.
MATH
accuracy · model bazowy Mistral 7B, 4-shot
13.1%
📄 Jiang et al., Mistral 7B (arXiv:2310.06825)
Wynik bazowego modelu Mistral 7B z oficjalnego paperu.
GSM8K
accuracy · model bazowy Mistral 7B, 8-shot maj@8
52.2%
📄 Jiang et al., Mistral 7B (arXiv:2310.06825)
Wynik bazowego modelu Mistral 7B z oficjalnego paperu.

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)