Robocikowo>ROBOCIKOWO
K2 Horizon 375B-A23B

K2 Horizon 375B-A23B

375B-A23B · Rodzina: K2 Horizon
Flagowy model rodziny K2 Horizon od IFM: rzadki MoE o 375B parametrów (23B aktywnych), kontekst 512K, licencja Apache 2.0, w pełni otwarty.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceLLMModel rozumowania📁 K2 Horizon
Okno kontekstowe
512K
tokenów
Parametry
375B-A23B (375 mld total / 23 mld aktywne, MoE)
parametrów
Data premiery
3 września 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

K2 Horizon 375B-A23B to flagowy, największy model rodziny K2 Horizon opracowanej przez Institute of Foundation Models (IFM), udostępnionej 3 września 2026 roku. Wykorzystuje rzadką architekturę Mixture-of-Experts (MoE): przechowuje 375 mld parametrów, z których na każdy token aktywowanych jest około 23 mld.

Model obsługuje natywne okno kontekstowe 512K (524 288 tokenów) od etapu midtreningu. Jest przeznaczony do wymagających zadań: złożonego rozumowania, inżynierii oprogramowania, badań i długohoryzontowych zadań agentowych. Domyślnie działa z wysokim wysiłkiem rozumowania (reasoning effort "high").

K2 Horizon 375B-A23B jest w pełni otwarty zgodnie z zasadą LLM360: oprócz finalnego checkpointu IFM zapowiada publikację checkpointów pośrednich, danych, receptury treningu i kodu. Wagi są dostępne na licencji Apache 2.0 w formacie safetensors (BF16); dostępna jest też oficjalna wersja skwantyzowana FP8. Serwowanie zweryfikowano na jednym węźle 8× H200 (vLLM, SGLang, Transformers).

Klasyfikacja
LLMModel rozumowania
Rodzina: K2 Horizon
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 512K
🧩 Parametry: 375B-A23B (375 mld total / 23 mld aktywne, MoE)
Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
512K
tokenów
Parametry
375B-A23B (375 mld total / 23 mld aktywne, MoE)
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Serwowanie w BF16 na jednym węźle 8× H200 (tensor-parallel 8, expert-parallel), np. przez vLLM lub SGLang. Dostępna oficjalna wersja FP8 zmniejszająca wymagania pamięci.
Funkcje:Używanie narzędziFine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Zaawansowane rozumowanie
Zdolność do wieloetapowego, ustrukturyzowanego rozumowania: analiza problemów, planowanie kroków, wnioskowanie na podstawie hipotez. Modele reasoning-first (np. GPT-5.1 Thinking) dedykują część inferencji na łańcuchy myślowe zanim udzielą odpowiedzi.
Kategoria: reasoning
Rozumowanie matematyczne
Zdolność modelu do rozwiązywania zadań matematycznych wymagających wieloetapowego rozumowania — równania, dowody, kombinatoryka, geometria, rachunek różniczkowy, zadania konkursowe.
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Kodowanie agentowe
Wielogodzinne, wieloetapowe zadania programistyczne wykonywane samodzielnie przez model: klonowanie repozytorium, uruchamianie testów, iteracja poprawek, integracja z narzędziami CLI. Charakterystyczne dla wariantów Codex (GPT-5.1-Codex-Mini, Codex-Max).
Kategoria: coding
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning
Adaptacyjny wysiłek rozumowania
Model sam decyduje ile 'myślenia' poświęcić na konkretne zapytanie: proste pytania odpowiadane szybko, złożone problemy dostają więcej cykli inferencji. Cecha GPT-5.1 (Instant i Thinking) skracająca czas dla łatwych zadań, wydłużająca dla trudnych.
Kategoria: reasoning

Wyniki benchmarków

16 benchmarków
GPQA
accuracy · high reasoning effort
87.3%
📄 IFM
GPQA Diamond
Humanity's Last Exam (HLE)
accuracy · high reasoning effort
32.0%
📄 IFM
Humanity’s Last Exam (without tools)
Terminal-Bench 2.0
accuracy · high reasoning effort
70.2%
📄 IFM
Terminal-Bench 2.1
SWE-Bench Pro
accuracy · high reasoning effort
42.6%
📄 IFM
SWE-Bench Pro (strict, no internet)
GDPval-AA
Elo · high reasoning effort
1441Elo
📄 IFM
GDPval-AA (real-world professional tasks, Elo)
SciCode
accuracy · high reasoning effort
42.7%
📄 IFM
Scientific coding
MCPMark
accuracy · high reasoning effort
67.7%
📄 IFM
MCP tool use
Toolathlon Verified
accuracy · high reasoning effort
65.3%
📄 IFM
Agentic tool use
BrowseComp
accuracy · high reasoning effort
72.8%
📄 IFM
Deep web research
tau3-Banking
accuracy · high reasoning effort
34.0%
📄 IFM
Agentic tool use
Apex-Agents (pass@1)
accuracy · high reasoning effort
24.8%
📄 IFM
Long-horizon professional workflows
Automation Bench Public
accuracy · high reasoning effort
25.3%
📄 IFM
Workflow automation
WildClawBench
accuracy · high reasoning effort
50.9%
📄 IFM
In-the-wild agentic tasks (English text-only subset)
CritPt
accuracy · high reasoning effort
8.6%
📄 IFM
Frontier physics reasoning
AA-LCR
accuracy · high reasoning effort
76.0%
📄 IFM
Long-context reasoning
SWE-Atlas-QnA (strict)
accuracy · high reasoning effort
48.4%
📄 IFM
Repo-level code Q&A (no internet)

Architektura techniczna

Techniki trenowania (Training Techniques)