Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

DeepSeek-V4-Flash używa realnie dwóch z czterech strumieni mHC

Pan Robocik3 października 2026 · 3 min czytania
DeepSeek-V4-Flash używa realnie dwóch z czterech strumieni mHC

Inżynierowie Huawei zmierzyli, jak DeepSeek-V4-Flash faktycznie korzysta ze swojej czterostrumieniowej ścieżki rezydualnej mHC. Typowy blok sieci używa realnie około dwóch strumieni, a mieszalniki rezydualne w warstwach 22–42 można zastąpić macierzą jednostkową bez straty jakości. mHC to jeden z trzech filarów architektury DeepSeek-V4.

Najważniejsze w skrócie

  • Analiza Huawei Technologies z 4 września na arXiv, checkpoint 0731 DeepSeek-V4-Flash
  • Model: 43 warstwy MoE, 284 mld parametrów (13 mld aktywnych), 86 punktów pomiarowych
  • Efektywna liczba używanych strumieni: 1,998 przy odczycie i 1,775 przy zapisie, przy czterech dostępnych
  • Mieszalniki z warstw 22–42 podmienione na macierz jednostkową: średnia z sześciu testów rośnie z 84,22 do 84,26 pkt
  • Ta sama operacja na warstwach 0–21 podnosi perplexity C4 o 41,4 proc. i ścina średnią do 80,94 pkt

Cztery strumienie, dwa realnie obciążone

mHC, czyli manifold-constrained Hyper-Connections, rozszerza pojedynczy strumień rezydualny transformera na cztery równoległe, mieszane na każdym sublayerze. Zmierzone obciążenie rozkłada się jednak na 1,998 strumienia przy odczycie i 1,775 przy zapisie.

1,998efektywna liczba strumieni przy odczycie, z czterech dostępnych — przy zapisie 1,775arXiv:2609.05309

To nie jest przy tym jeden globalnie dominujący strumień. Strumienie 0 i 1 dominują w 32 z 44 punktów w warstwach 0–21, strumienie 2 i 3 w 36 z 42 punktów w warstwach 22–42, a podobieństwo kosinusowe 0,404 potwierdza, że reprezentacje pozostają kierunkowo różne. Wcześniejsza analiza modeli 120M i 360M opisywała twardy collapse do jednego strumienia — przy 284 mld parametrów to nierówne obciążenie, nie zapaść.

Późne mieszanie jest zbędne, wczesne nie

Odchylenie mieszalnika od Macierz jednostkowa: Macierz kwadratowa z jedynkami na przekątnej i zerami poza nią. Mnożenie przez nią niczego nie zmienia, więc każdy strumień przechodzi dalej bez mieszania z pozostałymi. spada z 0,046 w warstwach 0–21 do 0,009 w warstwach 22–42. Wymiana późnych mieszalników na identyczność podnosi perplexity C4 o 1,9 proc., a średnia z ARC-Easy, ARC-Challenge, PIQA, HellaSwag, MMLU i GSM8K rośnie z 84,22 do 84,26 pkt. Ta sama operacja we wczesnych warstwach kosztuje 41,4 proc. perplexity i 3,28 pkt średniej. Praktycznie: w drugiej połowie modelu można przy inferencji pominąć iteracje Sinkhorna–Knoppa.

…
Znaczenie symboli
…
mieszalnik rezydualny warstwy l — macierz, która miesza cztery strumienie
…
macierz jednostkowa 4×4, czyli brak mieszania: każdy strumień idzie dalej osobno
…
indeks warstwy, model ma 43 warstwy o numerach od 0 do 42
WariantŚrednia z sześciu zadańPerplexity C4
Baseline — mHC bez zmian84,22odniesienie
Mieszalniki 22–42 → macierz jednostkowa84,26+1,9 proc.
Podmiana późnych mieszalników na macierz jednostkową przy inferencji. Średnia liczona z sześciu zadań: ARC-Easy, ARC-Challenge, PIQA, HellaSwag, MMLU i GSM8K.

Dlaczego to ważne?

Szerokość architektury nie przekłada się automatycznie na pojemność obliczeniową. To, ile z czterech strumieni realnie pracuje, rozstrzyga trening, a nie projekt. Dla projektujących kolejne modele część kosztownych stopni swobody mHC da się wyciąć bez straty jakości, a oszczędność zainkasować przy inferencji. Wynik architektoniczny ogłoszony w pracy premierowej nie przesądza też, jak dany mechanizm zachowa się w gotowym modelu po 32 bilionach tokenów treningu.

Co dalej?

  • Huawei proponuje uzależnić mapę zapisu, a może i mieszalnik, od wyjścia gałęzi, nie tylko od stanów wejściowych — to wymaga porównania na dopasowanych treningach.
  • Rynek już się rozjeżdża: Hy4-preview stosuje Hyper-Connections z mieszalnikiem jednostkowym, a Qwen3.8-Next bramkowany residual zależny od danych.
  • Analiza obejmuje jeden checkpoint, więc odróżnienie własności mHC od skutku tego treningu wymaga danych z przebiegu treningu.

Źródła

Udostępnij ten artykuł