Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

NCP-ArchPreview: strata OLMo-3 przy połowie budżetu tokenów

Pan Robocik26 września 2026 · 2 min czytania
NCP-ArchPreview: strata OLMo-3 przy połowie budżetu tokenów

Shanghai AI Lab i LUMIA Lab z Shanghai Jiao Tong University udostępniły NCP-ArchPreview — model językowy o 8,94 mld parametrów, który obok następnego tokena przewiduje też następny „koncept" w wyuczonej przestrzeni ukrytej. Model osiąga końcową stratę pretreningową OLMo-3-7B, zużywając 51,3% jego budżetu tokenów. Wagi są na licencji Apache-2.0.

Najważniejsze w skrócie

  • 8,94 mld parametrów, trening na 5,73 bln tokenów z korpusu Dolma-3
  • Strata OLMo-3-7B osiągnięta przy 51,3% budżetu tokenów — zbieżność 1,95×
  • Średnia z benchmarków: 49,04 wobec 46,59 dla OLMo-3-7B
  • +5,99 pkt proc. na GSM8K, +4,28 pkt proc. na HumanEval
  • Wagi obu etapów na Hugging Face, licencja Apache-2.0
51,3%budżetu tokenów OLMo-3-7B wystarczy, by NCP-ArchPreview osiągnął jego końcową stratę pretreningowąKarta modelu NCP-ArchPreview (Stage 1)

Trzy moduły zamiast jednego stosu

Architektura dzieli się na trzy części. Uśrednienie czterech kolejnych stanów enkodera daje jeden ciągły koncept, a osobny moduł przewiduje następny koncept, zanim dekoder wróci do poziomu tokenów.

Ścieżka tokenowa
Enkoder tokenów16 warstw → stany kontekstowe
Uśrednienie czterech kolejnych stanówjeden ciągły koncept
Ścieżka konceptowa
Concept Module8 warstw, 32 książki kodowe × 128 słów kodowych
Ścieżka tokenowa
Dekoder tokenów16 warstw: stany tokenów + predykcje konceptów
Rozkład następnego tokenaAllow
Trzy moduły NCP-ArchPreview. Słownik konceptów powstaje przez kwantyzację produktową.
…
Sekwencja konceptów jest czterokrotnie krótsza od tokenowej — stąd osobny, tańszy moduł planujący.
Znaczenie symboli
…
długość sekwencji konceptów
…
długość sekwencji tokenów
…
liczba stanów tokenowych uśrednianych w jeden koncept

Czego ta liczba nie znaczy

Karta modelu sama stawia zastrzeżenie: porównanie zbieżności mierzy liczbę tokenów potrzebnych do osiągnięcia zadanej straty. Nie mierzy czasu treningu ani przepustowości przy generowaniu. Przy 85% standardowego budżetu obliczeniowego model zbliża się do straty bazowego modelu 8,9 mld o ściśle dopasowanej liczbie parametrów — to węższa i uczciwsza wersja tej samej tezy.

Siedemnaście milionów parametrów jako interfejs

Wyuczona przestrzeń ukryta przydaje się po pretreningu. Aktualizacja samego modułu VQ — 17 mln parametrów, przy zamrożonym szkielecie tokenowym — daje lekki interfejs do adaptacji dziedzinowej. Wstrzyknięcie reprezentacji konceptów do Drafter: Mały, szybki model, który podpowiada kilka kolejnych tokenów naraz, a główny model tylko je akceptuje lub odrzuca. DFlash2 podniosło średnią długość akceptowanego ciągu o 4,17% przy pomijalnym narzucie.

Dlaczego to ważne?

Pomysł, żeby model planował na poziomie grubszym niż token, wraca od lat i zwykle kończył się na małej skali. Tu skala wynosi 8,9 mld parametrów i 5,73 bln tokenów, a wagi i kod ewaluacyjny są otwarte. Jeśli wynik utrzyma się przy niezależnej weryfikacji, część zysku kupowanego dziś większym budżetem danych da się wziąć z samej architektury.

Co dalej?

  • Kod treningowy nie jest jeszcze opublikowany — karta modelu oznacza go jako „coming soon"
  • Kod ewaluacyjny jest dostępny na GitHubie, więc wyniki można powtórzyć niezależnie
  • Na Hugging Face są dwa etapy: baza po pretreningu i zbudowany na niej Stage 2

Źródła

Udostępnij ten artykuł