Robocikowo>ROBOCIKOWO
NCP-ArchPreview

NCP-ArchPreview

ArchPreview · Dolma3 · 8.9B · Stage 1
Latentowy model językowy (8,94B) realizujący „Next Concept Prediction”: obok następnego tokena przewiduje też następny „koncept” w przestrzeni utajonej. Wyprzedza OLMo-3-7B.
🔬 Research🔬 Research only⚖ Open sourceLLM
Parametry
8.94B
parametrów
Data premiery
14 września 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie

Przegląd

NCP-ArchPreview to model językowy o 8,94 mld parametrów opracowany przez Shanghai AI Lab i LUMIA Lab (Shanghai Jiao Tong University). Wykracza poza klasyczne przewidywanie następnego tokena (Next Token Prediction), wprowadzając „Next Concept Prediction” (NCP) — obok tokena model przewiduje też następny „koncept”, czyli wyuczoną reprezentację utajoną obejmującą średnio ok. cztery tokeny.

Architektura ma trzy moduły: Token Encoder (16 warstw) przetwarzający tekst wejściowy, Concept Module (8 warstw) przewidujący kolejne koncepty za pomocą kwantyzacji produktowej z 32 książkami kodów, oraz Token Decoder (16 warstw) generujący rozkład tokenów na podstawie predykcji konceptów. Rezydualne połączenia między modułami przepuszczają informację przy zachowaniu przyczynowości; generacja zachowuje standardowy interfejs next-token.

Wydanie Stage 1 wstępnie wytrenowano na zbiorze Dolma 3 Mix (5,73 bln tokenów) z trzema wspólnymi celami: next-token prediction, next-concept prediction oraz dopasowaniem kwantyzacji wektorowej. Model osiąga wynik Overall AVG 49,04 (wobec 46,59 dla OLMo-3-7B), z wyraźną poprawą na zadaniach matematycznych i programistycznych. Wagi na licencji Apache 2.0.

Klasyfikacja
LLM
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 8.94B
✓ Fine-tuning
📥 Wejście: tekst

Specyfikacja techniczna

Parametry
8.94B
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Trójmodułowa architektura (Token Encoder 16L + Concept Module 8L + Token Decoder 16L); kwantyzacja produktowa z 32 książkami kodów. Wydanie Stage 1.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
textcode

Możliwości i zastosowania

Natywne możliwości modelu
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language
Rozumowanie matematyczne
Zdolność modelu do rozwiązywania zadań matematycznych wymagających wieloetapowego rozumowania — równania, dowody, kombinatoryka, geometria, rachunek różniczkowy, zadania konkursowe.
Kategoria: reasoning
Programowanie
Generowanie, analizowanie i modyfikowanie kodu w wielu językach programowania. Obejmuje pisanie funkcji, debugowanie, refaktoryzację, code review, tworzenie testów. Mierzone benchmarkami takimi jak HumanEval, SWE-bench.
Kategoria: coding
Rozumowanie
Zdolność modelu do logicznego wnioskowania i rozwiązywania złożonych problemów.
Kategoria: reasoning

Wyniki benchmarków

1 benchmark
Overall AVG
average
49.04
📄 paper
Średnia zbiorcza; wyżej niż OLMo-3-7B (46,59) przy porównywalnej skali/danych.