Institute of Foundation Models udostępnił 3 września K2 Horizon — sześć modeli od 0,9 do 375 mld parametrów na licencji Apache 2.0. Nowością nie są same wagi, tylko to, co leży obok: checkpointy pośrednie, dane treningowe lub receptury ich budowy, kod, konfiguracje i logi. Wagi są już do pobrania.
Najważniejsze w skrócie
- Sześć modeli: 375B-A23B, 36B-A4B, 32B, 7B, 3,7B i 0,9B — wszystkie na Apache 2.0
- Otwarty cały cykl treningu: checkpointy pośrednie, dane lub receptury, kod, konfiguracje, logi, wyniki ewaluacji i wagi końcowe
- Model 36B-A4B używa MoVA, autorskiego mechanizmu rzadkiej atencji, aktywując ok. 4 mld parametrów na token
- Wariant 0,9B przekracza 48 punktów na AIME 2026 i mieści się w zegarkach oraz okularach
- Zbiory danych mają osobne licencje, m.in. ODC-BY, a nie Apache 2.0
Flota, nie pojedynczy model
Sześć modeli dzieli architekturę, słownik, metodologię treningu, interfejsy i narzędzia wdrożeniowe — wyjątkiem jest mniejszy słownik w wariancie 0,9B. Największy 375B-A23B to model MoE z rzadką aktywacją: 375 mld parametrów pojemności przy około 23 mld aktywowanych na token.
| Model | Parametry | Aktywne / token | Docelowe środowisko |
|---|---|---|---|
| 375B-A23B | 375 mld | ~23 mld | serwerownia, wdrożenia enterprise |
| 36B-A4B (MoVA) | 36 mld | ~4 mld | stacja robocza, wydajne serwowanie |
| 32B (gęsty) | 32 mld | 32 mld | lokalna stacja robocza |
| 7B | 7 mld | 7 mld | telefon, urządzenia on-device |
| 3,7B | 3,7 mld | 3,7 mld | telefon, urządzenia on-device |
| 0,9B | 0,9 mld | 0,9 mld | zegarek, okulary (po kwantyzacji) |
MoVA: rzadka atencja zamiast rzadkich warstw FFN
Najciekawszy technicznie jest 36B-A4B. IFM połączył w nim własny mechanizm MoVA, czyli Mixture-of-Value-Attention, z warstwami Mixture of Experts, aktywując około 4 mld parametrów na token. Efekt: wynik zbliżony do gęstego 32B przy ośmiokrotnie mniejszej liczbie aktywnych parametrów. Obecność obu modeli w jednej rodzinie daje rzadką okazję porównania architektur gęstej i rzadkiej, trenowanych w tych samych warunkach.
Co dokładnie jest otwarte
Za hasłem o pełnej otwartości stoi konkretna lista: dane treningowe albo metody ich konstrukcji i skład mieszanek, kod treningowy, konfiguracje, checkpointy pośrednie?Checkpoint pośredni: Zapis wag modelu w trakcie treningu, a nie po jego zakończeniu. Pozwala prześledzić, w którym momencie pojawiają się konkretne zdolności — i powtórzyć trening od tego miejsca., szczegółowe logi, wyniki ewaluacji i wagi końcowe. Modele i kod trafiają na licencję Apache 2.0, zbiory danych na własnych licencjach — tam, gdzie redystrybucja jest niemożliwa, IFM opisuje sposób ich budowy. To kontynuacja zasady ogłoszonej w pracy LLM360 z 2023 roku.
Dlaczego to ważne?
Otwarte wagi pozwalają uruchomić model, ale nie mówią, jak powstał. Otwarty cykl treningu zmienia checkpoint z czarnej skrzynki w materiał badawczy — można prześledzić, w którym momencie pojawia się planowanie czy użycie narzędzi, i powtórzyć metodę na własnych danych. Dla zespołów bez budżetu na trening od zera to różnica między kopiowaniem a rozumieniem.
Co dalej?
- Wagi wszystkich sześciu modeli są już na Hugging Face, wraz z wariantami GGUF i FP8 opublikowanymi 3 września
- IFM zastrzega, że zadania wymagające długiej eksploracji i wielokrotnego wychodzenia z błędu, jak TerminalBench, pozostają poza zasięgiem najmniejszych modeli
Źródła
- IFM — Introducing K2 Horizon: Frontier Performance, Radically Open
- Hugging Face — IFM/K2-Horizon-375B-A23B





