DF
Bezstratny „drafter” block-diffusion do speculative decoding (Inco AI). Model draftowy 2B przewiduje cały blok tokenów naraz, dając do 3,43× przyspieszenia bez zmiany wyjścia modelu docelowego.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceWyspecjalizowane AI
Parametry
2B (drafter)
parametrów
Data premiery
1 stycznia 2026
Dostęp:DownloadWdrożenie:💻 Lokalnie
Przegląd
Klasyfikacja
Wyspecjalizowane AI
Dostęp i wdrożenie
Pobieranie
Lokalnie
Wagi: Open source
Kluczowe parametry
🧩 Parametry: 2B (drafter)
📥 Wejście: tekst
Specyfikacja techniczna
Parametry
2B (drafter)
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Lekki model draftowy 2B (BF16), sparowany z modelem docelowym w speculative decoding; 7–8 tokenów draftu na krok weryfikacji.
Modalności
⬇ Wejście (Input)
text
⬆ Wyjście (Output)
text
Możliwości i zastosowania
Natywne możliwości modelu
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Modelowanie języka
Zdolność przewidywania kolejnych tokenów i generowania spójnego tekstu w języku naturalnym na podstawie poprzedzającego kontekstu.
Kategoria: language
Wyniki benchmarków
1 benchmark
GSM8K (przyspieszenie speculative decoding)
współbieżność 1
3.43×
📄 technical_report
Przyspieszenie bezstratne względem dekodowania modelu docelowego.
Architektura techniczna
Rdzeń architektury (Core Architecture)