
Gęsty (dense) model 32B z rodziny K2 Horizon od IFM: 512K kontekstu, licencja Apache 2.0, w pełni otwarty (LLM360), z rozumowaniem i tool use.
Okno kontekstowe
512K
tokenów
Parametry
32B (dense, decoder-only)
parametrów
Data premiery
3 września 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 512K
🧩 Parametry: 32B (dense, decoder-only)
✓ Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst
Specyfikacja techniczna
Okno kontekstowe
512K
tokenów
Parametry
32B (dense, decoder-only)
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Serwowanie w BF16 na 2× H200 z tensor-parallel (TP=2), np. przez vLLM lub SGLang (z FlashAttention-3). Zalecane sampling: temperature 1.0, top_p 0.95.
Funkcje:✓ Używanie narzędzi✓ Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode
Możliwości i zastosowania
Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Adaptacyjny wysiłek rozumowania
Model sam decyduje ile 'myślenia' poświęcić na konkretne zapytanie: proste pytania odpowiadane szybko, złożone problemy dostają więcej cykli inferencji. Cecha GPT-5.1 (Instant i Thinking) skracająca czas dla łatwych zadań, wydłużająca dla trudnych.
Kategoria: reasoning
Wyniki benchmarków
9 benchmarków
GPQA
accuracy · high reasoning effort
82.3%
📄 IFM
GPQA Diamond
Humanity's Last Exam (HLE)
accuracy · high reasoning effort
22.8%
📄 IFM
Humanity's Last Exam (without tools)
Terminal-Bench 2.0
accuracy · high reasoning effort
36.6%
📄 IFM
Terminal-Bench 2.1
SciCode
accuracy · high reasoning effort
30.2%
📄 IFM
Scientific coding
AA-LCR
accuracy · high reasoning effort
65.3%
📄 IFM
Long-context reasoning
CritPt
accuracy · high reasoning effort
1.4%
📄 IFM
Frontier physics reasoning
tau3-Banking
accuracy · high reasoning effort
22.5%
📄 IFM
Agentic tool use
AA-Omniscience Accuracy
accuracy · high reasoning effort
16.8%
📄 IFM
Knowledge accuracy
AA-Omniscience Non-Hallucination
accuracy · high reasoning effort
58.3%
📄 IFM
Non-hallucination rate
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)