Cloudflare udostępniło Clef i Clef-flash — modele decyzyjne, które zwracają prawdopodobieństwa dla opcji ze schematu zamiast generować tekst. Premiera odbyła się 1 października 2026: wagi na Hugging Face, licencja Apache 2.0, hosting w Workers AI, API zgodne z Jevem. Mediana opóźnienia wariantu flash to 38,8 ms.
Najważniejsze w skrócie
- Clef to model 27B na backbonie Qwen3.8-27B z koderem wizyjnym, Clef-flash — 9B na Qwen3.5-9B
- Okno kontekstu 64 tys. tokenów, wejście: tekst, JSON, obrazy i wideo
- Mediana opóźnienia: 38,8 ms dla flash, 209,3 ms dla Clef, 524,1 ms dla Jeva
- Pierwsze miejsce w Jev Decision Index i przewaga na 43 benchmarkach według Cloudflare
- Licencja Apache 2.0, wagi na Hugging Face, hosting w Cloudflare Workers AI
Jeden przebieg prefill, zero generowania
Clef nie jest autoregresywny?Model autoregresywny: Taki, który tworzy odpowiedź token po tokenie, za każdym razem doklejając kolejny element do tego, co już powiedział. Każdy token to osobny przebieg sieci.. Model wykonuje pojedynczy przebieg prefill na stanie i schemacie, a potem równolegle punktuje wszystkie dopuszczalne wartości pól. Zamiast dziesiątek kroków dekodowania zostaje jedno przejście — stąd różnica w opóźnieniu.
Drugi element to dwustopniowe routowanie uwagi: dopuszczalne opcje najpierw wyciągają ze stanu istotny kontekst, a potem pola mogą się nawzajem widzieć przed ocenianiem. W praktyce model decyduje o kilku polach naraz, zachowując między nimi spójność.
Dwa warianty, dwa kompromisy
| Parametr | Clef | Clef-flash |
|---|---|---|
| Rozmiar | 27B | 9B |
| Backbone | Qwen3.8-27B | Qwen3.5-9B |
| Mediana opóźnienia | 209,3 ms | 38,8 ms |
| Wejście multimodalne | tekst, JSON, obraz, wideo | tekst, JSON, obraz, wideo |
| Licencja | Apache 2.0 | Apache 2.0 |
Zgodność z API jako dźwignia
Największą przewagą nie jest architektura, lecz interfejs. Clef jest w pełni zgodny z API Jeva, więc zespół korzystający dziś z zamkniętego modelu TypeSafe AI podmienia endpoint i zostaje przy własnym kodzie. To ten sam schemat, którym chmury przejmowały ruch z API OpenAI.
Cztery parametry, które decydują o wdrożeniu:
Baza modelu to Qwen3.8-27B, a wagi leżą na Hugging Face Hub — to trzeci w tym tygodniu model decyzyjny zbudowany na otwartych wagach Qwen.
Dlaczego to ważne?
Warstwa decyzyjna w agentach to ruch o wysokiej częstotliwości i niskiej wartości jednostkowej — dokładnie taki, na którym zarabia CDN. Cloudflare sprzedaje tu nie model, lecz brzeg sieci. Otwarte wagi są przy tym argumentem przeciw uzależnieniu od dostawcy, a nie produktem samym w sobie.
Co dalej?
- Samoobsługowa platforma RL do dostrajania modeli jest zapowiedziana, ale nie ma daty premiery
- Dostrajanie na zamówienie prowadzi na razie zespół inżynierów wdrożeniowych Cloudflare
- Wyniki na 43 benchmarkach podaje sam dostawca, bez niezależnej weryfikacji
Źródła
- Cloudflare Blog — Clef decision models
- Hugging Face — Cloudflare/clef
- Hugging Face — Cloudflare/clef-flash





