Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

K2 Horizon: sześć otwartych modeli i cały przepis na trening

Pan Robocik7 września 2026 · 3 min czytania
K2 Horizon: sześć otwartych modeli i cały przepis na trening

Institute of Foundation Models udostępnił 3 września K2 Horizon — sześć modeli od 0,9 do 375 mld parametrów na licencji Apache 2.0. Nowością nie są same wagi, tylko to, co leży obok: checkpointy pośrednie, dane treningowe lub receptury ich budowy, kod, konfiguracje i logi. Wagi są już do pobrania.

Najważniejsze w skrócie

  • Sześć modeli: 375B-A23B, 36B-A4B, 32B, 7B, 3,7B i 0,9B — wszystkie na Apache 2.0
  • Otwarty cały cykl treningu: checkpointy pośrednie, dane lub receptury, kod, konfiguracje, logi, wyniki ewaluacji i wagi końcowe
  • Model 36B-A4B używa MoVA, autorskiego mechanizmu rzadkiej atencji, aktywując ok. 4 mld parametrów na token
  • Wariant 0,9B przekracza 48 punktów na AIME 2026 i mieści się w zegarkach oraz okularach
  • Zbiory danych mają osobne licencje, m.in. ODC-BY, a nie Apache 2.0

Flota, nie pojedynczy model

Sześć modeli dzieli architekturę, słownik, metodologię treningu, interfejsy i narzędzia wdrożeniowe — wyjątkiem jest mniejszy słownik w wariancie 0,9B. Największy 375B-A23B to model MoE z rzadką aktywacją: 375 mld parametrów pojemności przy około 23 mld aktywowanych na token.

ModelParametryAktywne / tokenDocelowe środowisko
375B-A23B375 mld~23 mldserwerownia, wdrożenia enterprise
36B-A4B (MoVA)36 mld~4 mldstacja robocza, wydajne serwowanie
32B (gęsty)32 mld32 mldlokalna stacja robocza
7B7 mld7 mldtelefon, urządzenia on-device
3,7B3,7 mld3,7 mldtelefon, urządzenia on-device
0,9B0,9 mld0,9 mldzegarek, okulary (po kwantyzacji)
Flota K2 Horizon — od urządzeń ubieralnych po serwerownię. Wszystkie warianty mają wsparcie dla kwantyzacji. Dane: IFM.

MoVA: rzadka atencja zamiast rzadkich warstw FFN

Najciekawszy technicznie jest 36B-A4B. IFM połączył w nim własny mechanizm MoVA, czyli Mixture-of-Value-Attention, z warstwami Mixture of Experts, aktywując około 4 mld parametrów na token. Efekt: wynik zbliżony do gęstego 32B przy ośmiokrotnie mniejszej liczbie aktywnych parametrów. Obecność obu modeli w jednej rodzinie daje rzadką okazję porównania architektur gęstej i rzadkiej, trenowanych w tych samych warunkach.

Co dokładnie jest otwarte

Za hasłem o pełnej otwartości stoi konkretna lista: dane treningowe albo metody ich konstrukcji i skład mieszanek, kod treningowy, konfiguracje, Checkpoint pośredni: Zapis wag modelu w trakcie treningu, a nie po jego zakończeniu. Pozwala prześledzić, w którym momencie pojawiają się konkretne zdolności — i powtórzyć trening od tego miejsca., szczegółowe logi, wyniki ewaluacji i wagi końcowe. Modele i kod trafiają na licencję Apache 2.0, zbiory danych na własnych licencjach — tam, gdzie redystrybucja jest niemożliwa, IFM opisuje sposób ich budowy. To kontynuacja zasady ogłoszonej w pracy LLM360 z 2023 roku.

Dlaczego to ważne?

Otwarte wagi pozwalają uruchomić model, ale nie mówią, jak powstał. Otwarty cykl treningu zmienia checkpoint z czarnej skrzynki w materiał badawczy — można prześledzić, w którym momencie pojawia się planowanie czy użycie narzędzi, i powtórzyć metodę na własnych danych. Dla zespołów bez budżetu na trening od zera to różnica między kopiowaniem a rozumieniem.

Co dalej?

  • Wagi wszystkich sześciu modeli są już na Hugging Face, wraz z wariantami GGUF i FP8 opublikowanymi 3 września
  • IFM zastrzega, że zadania wymagające długiej eksploracji i wielokrotnego wychodzenia z błędu, jak TerminalBench, pozostają poza zasięgiem najmniejszych modeli

Źródła

Udostępnij ten artykuł