Natywnie multimodalny model MoE z rodziny GLM-5 (Z.ai): 320 mld parametrów, 18 mld aktywnych, hybrydowa uwaga rzadka + liniowa, okno kontekstu 1M tokenów.
Okno kontekstowe
1M
tokenów
Parametry
320B (18B active)
parametrów
Max output
128 000
tokenów
Dostęp:APIDownloadHostedWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Dostęp i wdrożenie
APIPobieranieHostowane
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 1M
🧩 Parametry: 320B (18B active)
✓ Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst, obraz, wideo, dokumenty
Specyfikacja techniczna
Okno kontekstowe
1M
tokenów
Parametry
320B (18B active)
parametrów
Max output tokens
128 000
tokenów na odpowiedź
Licencja
MIT
Wymagania sprzętowe
Wdrożenie lokalne wspierane przez SGLang, vLLM, TokenSpeed, Transformers, KTransformers i Unsloth; wagi w BF16 (oraz FP8/E4M3). Model MoE 320B wymaga zasobów klasy multi-GPU.
Funkcje:✓ Używanie narzędzi✓ Fine-tuning
Modalności
⬇ Wejście (Input)
textimagevideodocuments
⬆ Wyjście (Output)
textcode
Możliwości i zastosowania
Natywne możliwości modelu
Rozumowanie
Zdolność modelu do wieloetapowego wnioskowania logicznego, rozwiązywania złożonych problemów i rozkładania zadań na kroki.
Kategoria: reasoning
Programowanie
Generowanie, uzupełnianie, wyjaśnianie i debugowanie kodu w wielu językach programowania.
Kategoria: coding
Wywoływanie funkcji
Natywne wsparcie dla ustrukturyzowanego wykorzystania narzędzi, umożliwiające przepływy pracy oparte na agentach.
Kategoria: planning
Długi kontekst
Przetwarzanie bardzo długich danych wejściowych (dziesiątki–setki tysięcy tokenów) przy zachowaniu spójności.
Kategoria: language
Wielojęzyczność
Rozumienie i generowanie tekstu w wielu językach oraz tłumaczenie między nimi.
Kategoria: language
Rozumienie wideo
Zdolność analizy wideo poprzez przetwarzanie sekwencji klatek.
Kategoria: video
Wyjście strumieniowe
Wiadomości strumieniowe umożliwiają pobieranie treści w czasie rzeczywistym, gdy model generuje odpowiedzi, bez czekania na wygenerowanie całej odpowiedzi. Takie podejście może znacząco poprawić doświadczenie użytkownika, zwłaszcza podczas tworzenia długich treści tekstowych, ponieważ użytkownicy mogą od razu zobaczyć, że odpowiedź zaczyna się pojawiać.
Kategoria: reasoning
Przeplatane wejście multimodalne
Zdolność do dowolnego łączenia tekstu i obrazu w dowolnej kolejności w ramach jednego polecenia.
Kategoria: reasoning
Wyniki benchmarków
4 benchmarki
DeepSWE v1.1
mini-swe-agent harness, temperature=0.95, top_p=1.0, 400K context
63.4
📄 Oficjalny blog Z.ai (GLM-5.3-Flash)
GLM-5.3-Flash 63.4 vs GLM-5.2 46.2.
AutomationBench
AutomationBench v1.0.6
48.8
📄 Oficjalny blog Z.ai (GLM-5.3-Flash)
GLM-5.3-Flash 48.8 vs GLM-5.2 26.2.
Z.ai Code Bench v1.0
max effort, Claude Code 2.1.207
29.0
📄 Oficjalny blog Z.ai (GLM-5.3-Flash)
Przy max effort niemal dorównuje Claude Opus 4.8 (29.0 vs 29.5).
Artificial Analysis Intelligence Index v4.1.1
57
📄 Oficjalny blog Z.ai (GLM-5.3-Flash), Artificial Analysis
Wynik 57 przy koszcie ~$0.045 za zadanie (cena promocyjna).
Cennik
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
