Shanghai AI Lab i LUMIA Lab z Shanghai Jiao Tong University udostępniły NCP-ArchPreview — model językowy o 8,94 mld parametrów, który obok następnego tokena przewiduje też następny „koncept" w wyuczonej przestrzeni ukrytej. Model osiąga końcową stratę pretreningową OLMo-3-7B, zużywając 51,3% jego budżetu tokenów. Wagi są na licencji Apache-2.0.
Najważniejsze w skrócie
- 8,94 mld parametrów, trening na 5,73 bln tokenów z korpusu Dolma-3
- Strata OLMo-3-7B osiągnięta przy 51,3% budżetu tokenów — zbieżność 1,95×
- Średnia z benchmarków: 49,04 wobec 46,59 dla OLMo-3-7B
- +5,99 pkt proc. na GSM8K, +4,28 pkt proc. na HumanEval
- Wagi obu etapów na Hugging Face, licencja Apache-2.0
Trzy moduły zamiast jednego stosu
Architektura dzieli się na trzy części. Uśrednienie czterech kolejnych stanów enkodera daje jeden ciągły koncept, a osobny moduł przewiduje następny koncept, zanim dekoder wróci do poziomu tokenów.
Znaczenie symboli
- …
- długość sekwencji konceptów
- …
- długość sekwencji tokenów
- …
- liczba stanów tokenowych uśrednianych w jeden koncept
Czego ta liczba nie znaczy
Karta modelu sama stawia zastrzeżenie: porównanie zbieżności mierzy liczbę tokenów potrzebnych do osiągnięcia zadanej straty. Nie mierzy czasu treningu ani przepustowości przy generowaniu. Przy 85% standardowego budżetu obliczeniowego model zbliża się do straty bazowego modelu 8,9 mld o ściśle dopasowanej liczbie parametrów — to węższa i uczciwsza wersja tej samej tezy.
Siedemnaście milionów parametrów jako interfejs
Wyuczona przestrzeń ukryta przydaje się po pretreningu. Aktualizacja samego modułu VQ — 17 mln parametrów, przy zamrożonym szkielecie tokenowym — daje lekki interfejs do adaptacji dziedzinowej. Wstrzyknięcie reprezentacji konceptów do draftera?Drafter: Mały, szybki model, który podpowiada kilka kolejnych tokenów naraz, a główny model tylko je akceptuje lub odrzuca. DFlash2 podniosło średnią długość akceptowanego ciągu o 4,17% przy pomijalnym narzucie.
Dlaczego to ważne?
Pomysł, żeby model planował na poziomie grubszym niż token, wraca od lat i zwykle kończył się na małej skali. Tu skala wynosi 8,9 mld parametrów i 5,73 bln tokenów, a wagi i kod ewaluacyjny są otwarte. Jeśli wynik utrzyma się przy niezależnej weryfikacji, część zysku kupowanego dziś większym budżetem danych da się wziąć z samej architektury.
Co dalej?
- Kod treningowy nie jest jeszcze opublikowany — karta modelu oznacza go jako „coming soon"
- Kod ewaluacyjny jest dostępny na GitHubie, więc wyniki można powtórzyć niezależnie
- Na Hugging Face są dwa etapy: baza po pretreningu i zbudowany na niej Stage 2





