Robocikowo>ROBOCIKOWO
DF

DFlash2

2 (2B drafter)
Bezstratny „drafter” block-diffusion do speculative decoding (Inco AI). Model draftowy 2B przewiduje cały blok tokenów naraz, dając do 3,43× przyspieszenia bez zmiany wyjścia modelu docelowego.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceWyspecjalizowane AI
Parametry
2B (drafter)
parametrów
Data premiery
1 stycznia 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie

Przegląd

DFlash2 to technika optymalizacji inferencji — „drafter” block-diffusion do speculative decoding — dostarczana jako lekki model draftowy 2B (BF16). Zamiast przewidywać tokeny pojedynczo, DFlash2 przewiduje cały blok tokenów w jednym przebiegu i zachowuje najlepsze kandydatury na każdej pozycji, po czym lekki selektor wyznacza jedną spójną ścieżkę.

W szkielecie wykorzystuje „two-tap” dynamiczne konwolucje i jest zaprojektowany do generowania 7–8 tokenów draftu na krok weryfikacji. Metoda jest bezstratna: wyjście zachłanne (greedy) dokładnie odpowiada modelowi docelowemu, a podczas próbkowania zachowywany jest rozkład modelu docelowego.

Twórcą jest Inco AI (repozytorium mirrorowane m.in. przez z-lab). DFlash2 osiąga 3,43× przyspieszenia przy współbieżności 1 na zadaniu GSM8K. Metodę opisano w publikacji DFlash (ICML 2026, Chen, Liang, Liu). Udostępniono na licencji Apache 2.0; stosowana m.in. do modeli Qwen3.8 i GLM-5.3-Flash.

Klasyfikacja
Wyspecjalizowane AI
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 2B (drafter)
📥 Wejście: tekst

Specyfikacja techniczna

Parametry
2B (drafter)
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Lekki model draftowy 2B (BF16), sparowany z modelem docelowym w speculative decoding; 7–8 tokenów draftu na krok weryfikacji.
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
text

Możliwości i zastosowania

Natywne możliwości modelu
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language

Wyniki benchmarków

1 benchmark
GSM8K (przyspieszenie speculative decoding)
współbieżność 1
3.43×
📄 technical_report
Przyspieszenie bezstratne względem dekodowania modelu docelowego.

Architektura techniczna

Rdzeń architektury (Core Architecture)