Robocikowo>ROBOCIKOWO
K2 Horizon

K2 Horizon

Horizon · Rodzina: K2 Horizon
W pełni otwarta rodzina modeli językowych od IFM. Warianty MoE (375B-A23B, 36B-A4B z MoVA) i gęste (32B–0,9B), kontekst 512K, Apache 2.0.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceLLMModel rozumowania📁 K2 Horizon
Okno kontekstowe
512K
tokenów
Parametry
375B-A23B (flagowy); rodzina 0,9B–375B
parametrów
Data premiery
3 września 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

K2 Horizon to rodzina otwartych modeli językowych opracowana przez Institute of Foundation Models (IFM) — globalne laboratorium badawcze afiliowane przy MBZUAI, wywodzące się z zespołu LLM360. Flagowe warianty udostępniono 3 września 2026 na licencji Apache 2.0.

Architektura i warianty

Rodzina obejmuje warianty Mixture-of-Experts oraz modele gęste. Flagowy K2-Horizon-375B-A23B ma 375 mld parametrów, z których 23 mld jest aktywnych na token. Wariant K2-Horizon-36B-A4B (36 mld parametrów, 4 mld aktywnych) wykorzystuje autorski mechanizm Mixture-of-Value Attention (MoVA), rozszerzający routing ekspertów na warstwę uwagi. Modele gęste to warianty 32B, 7B, 3,7B i 0,9B. Wszystkie mają natywne okno kontekstu 512K tokenów (524 288).

Otwartość (LLM360)

Zgodnie z filozofią LLM360, IFM zapowiada pełną otwartość: publikację wag, kodu treningowego, przepisu oraz danych treningowych (m.in. na licencjach typu ODC-BY). Modele są dystrybuowane także w formacie GGUF do uruchamiania lokalnego.

Wyniki

Flagowy 375B-A23B osiąga m.in. 87,3% na GPQA Diamond, 32,0% na Humanity’s Last Exam, 70,2% na Terminal-Bench 2.1 oraz 42,6% na SWE-Bench Pro.

Klasyfikacja
LLMModel rozumowania
Rodzina: K2 Horizon
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open source
Kluczowe parametry
📏 Kontekst: 512K
🧩 Parametry: 375B-A23B (flagowy); rodzina 0,9B–375B
Narzędzia · ✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Okno kontekstowe
512K
tokenów
Parametry
375B-A23B (flagowy); rodzina 0,9B–375B
parametrów
Licencja
Apache 2.0
Funkcje:Używanie narzędziFine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning
Zaawansowane rozumowanie
Zdolność do wieloetapowego, ustrukturyzowanego rozumowania: analiza problemów, planowanie kroków, wnioskowanie na podstawie hipotez. Modele reasoning-first (np. GPT-5.1 Thinking) dedykują część inferencji na łańcuchy myślowe zanim udzielą odpowiedzi.
Kategoria: reasoning
Rozumowanie matematyczne
Zdolność modelu do rozwiązywania zadań matematycznych wymagających wieloetapowego rozumowania — równania, dowody, kombinatoryka, geometria, rachunek różniczkowy, zadania konkursowe.
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Kodowanie agentowe
Wielogodzinne, wieloetapowe zadania programistyczne wykonywane samodzielnie przez model: klonowanie repozytorium, uruchamianie testów, iteracja poprawek, integracja z narzędziami CLI. Charakterystyczne dla wariantów Codex (GPT-5.1-Codex-Mini, Codex-Max).
Kategoria: coding
Użycie narzędzi
Zdolność modelu do wywoływania zewnętrznych funkcji, API i narzędzi w trakcie rozmowy: kalkulator, wyszukiwarka, edytor kodu, baza danych. Model decyduje kiedy i jak użyć narzędzia oraz interpretuje jego wynik.
Kategoria: planning
Długi kontekst
Obsługa dużych okien kontekstowych — dziesiątek do setek tysięcy (lub milionów) tokenów wejścia. Umożliwia analizę całych baz kodu, długich dokumentów, wielu równolegle rozmów bez utraty wcześniejszych informacji. GPT-5.1 wspiera 400 000 tokenów.
Kategoria: language
Zdolności agentowe
Zdolność modelu do autonomicznego planowania i wykonywania wieloetapowych zadań poprzez sekwencyjne użycie narzędzi, utrzymywanie kontekstu i adaptację do wyników pośrednich.
Kategoria: planning
Adaptacyjny wysiłek rozumowania
Model sam decyduje ile 'myślenia' poświęcić na konkretne zapytanie: proste pytania odpowiadane szybko, złożone problemy dostają więcej cykli inferencji. Cecha GPT-5.1 (Instant i Thinking) skracająca czas dla łatwych zadań, wydłużająca dla trudnych.
Kategoria: reasoning

Wyniki benchmarków

4 benchmarki
GPQA
accuracy · GPQA Diamond
87.3%%
📄 IFM
Wariant K2-Horizon-375B-A23B.
Humanity's Last Exam (HLE)
accuracy
32.0%%
📄 IFM
Wariant K2-Horizon-375B-A23B.
Terminal-Bench 2.0
accuracy · Terminal-Bench 2.1
70.2%%
📄 IFM
Wariant K2-Horizon-375B-A23B; wersja benchmarku 2.1.
SWE-Bench Pro
accuracy
42.6%%
📄 IFM
Wariant K2-Horizon-375B-A23B.

Architektura techniczna

Techniki trenowania (Training Techniques)