Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Clef od Cloudflare: 38,8 ms na decyzję i zgodność z API Jeva

Pan Robocik11 października 2026 · 2 min czytania
Clef od Cloudflare: 38,8 ms na decyzję i zgodność z API Jeva

Cloudflare udostępniło Clef i Clef-flash — modele decyzyjne, które zwracają prawdopodobieństwa dla opcji ze schematu zamiast generować tekst. Premiera odbyła się 1 października 2026: wagi na Hugging Face, licencja Apache 2.0, hosting w Workers AI, API zgodne z Jevem. Mediana opóźnienia wariantu flash to 38,8 ms.

Najważniejsze w skrócie

  • Clef to model 27B na backbonie Qwen3.8-27B z koderem wizyjnym, Clef-flash — 9B na Qwen3.5-9B
  • Okno kontekstu 64 tys. tokenów, wejście: tekst, JSON, obrazy i wideo
  • Mediana opóźnienia: 38,8 ms dla flash, 209,3 ms dla Clef, 524,1 ms dla Jeva
  • Pierwsze miejsce w Jev Decision Index i przewaga na 43 benchmarkach według Cloudflare
  • Licencja Apache 2.0, wagi na Hugging Face, hosting w Cloudflare Workers AI
38,8 msmediana opóźnienia Clef-flash — 13 razy szybciej niż JevCloudflare, 1.10.2026

Jeden przebieg prefill, zero generowania

Clef nie jest Model autoregresywny: Taki, który tworzy odpowiedź token po tokenie, za każdym razem doklejając kolejny element do tego, co już powiedział. Każdy token to osobny przebieg sieci.. Model wykonuje pojedynczy przebieg prefill na stanie i schemacie, a potem równolegle punktuje wszystkie dopuszczalne wartości pól. Zamiast dziesiątek kroków dekodowania zostaje jedno przejście — stąd różnica w opóźnieniu.

Wejście
Stan + schemat pytańtekst, JSON, obraz lub wideo
Model
Jeden przebieg prefillbez generowania tokenów
Etap 1: opcje wyciągają kontekst ze stanuroutowanie uwagi
Etap 2: pola widzą się wzajemniespójność między polami
Równoległa punktacja wszystkich opcjiAllow
Prawdopodobieństwa zgodne ze schematemgotowe do użycia przez agenta
Ścieżka zapytania w Clef: od stanu i schematu do prawdopodobieństw

Drugi element to dwustopniowe routowanie uwagi: dopuszczalne opcje najpierw wyciągają ze stanu istotny kontekst, a potem pola mogą się nawzajem widzieć przed ocenianiem. W praktyce model decyduje o kilku polach naraz, zachowując między nimi spójność.

Dwa warianty, dwa kompromisy

ParametrClefClef-flash
Rozmiar27B9B
BackboneQwen3.8-27BQwen3.5-9B
Mediana opóźnienia209,3 ms38,8 ms
Wejście multimodalnetekst, JSON, obraz, wideotekst, JSON, obraz, wideo
LicencjaApache 2.0Apache 2.0
Specyfikacja obu modeli według kart na Hugging Face i wpisu na blogu Cloudflare.

Zgodność z API jako dźwignia

Największą przewagą nie jest architektura, lecz interfejs. Clef jest w pełni zgodny z API Jeva, więc zespół korzystający dziś z zamkniętego modelu TypeSafe AI podmienia endpoint i zostaje przy własnym kodzie. To ten sam schemat, którym chmury przejmowały ruch z API OpenAI.

Cztery parametry, które decydują o wdrożeniu:

Qwen3.8-27Bmodel bazowy wariantu Clef
64k ctxokno kontekstu
bf16 safetensorsformat wag
Jev-compatible APIpodmiana endpointu bez zmian w kodzie

Baza modelu to Qwen3.8-27B, a wagi leżą na Hugging Face Hub — to trzeci w tym tygodniu model decyzyjny zbudowany na otwartych wagach Qwen.

Cloudflare dokłada do tego deklarację dotyczącą zapytań: nie czytamy ich, nie przechowujemy i nie trenujemy na nich. To obietnica umowna, nie własność techniczna modelu — warto ją czytać razem z regulaminem Workers AI.

Dlaczego to ważne?

Warstwa decyzyjna w agentach to ruch o wysokiej częstotliwości i niskiej wartości jednostkowej — dokładnie taki, na którym zarabia CDN. Cloudflare sprzedaje tu nie model, lecz brzeg sieci. Otwarte wagi są przy tym argumentem przeciw uzależnieniu od dostawcy, a nie produktem samym w sobie.

Co dalej?

  • Samoobsługowa platforma RL do dostrajania modeli jest zapowiedziana, ale nie ma daty premiery
  • Dostrajanie na zamówienie prowadzi na razie zespół inżynierów wdrożeniowych Cloudflare
  • Wyniki na 43 benchmarkach podaje sam dostawca, bez niezależnej weryfikacji

Źródła

Udostępnij ten artykuł