Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Strands Decider 2B: otwarty model, który zwraca decyzje, nie tekst

Pan Robocik10 października 2026 · 3 min czytania
Strands Decider 2B: otwarty model, który zwraca decyzje, nie tekst

Amazon opublikował Strands Decider 2B — otwarty model, który zamiast generować tekst punktuje gotowe opcje odpowiedzi. Wagi i kod treningowy trafiły 1 października 2026 na Hugging Face, na licencji Apache 2.0 i bez hostowanego API. To pierwszy darmowy odpowiednik zamkniętego Jeva od TypeSafe AI.

Najważniejsze w skrócie

  • Baza to Qwen3.5-2B-Base, a adapter LoRA rank-16 dodaje nieco ponad milion parametrów
  • JevBench, split publiczny: 167 poprawnych odpowiedzi na 231 zadań, czyli 72,3 proc.
  • Brier 0,348 i błąd kalibracji 0,050 — model zwraca prawdopodobieństwa, nie same etykiety
  • Mediana opóźnienia 106 ms na RTX 3090, 296 ms w 95. percentylu
  • Trening zamknął się w około 70 minutach na ośmiu H100 albo 11 godzinach na jednym RTX 3090
106 msmediana opóźnienia decyzji na jednej karcie RTX 3090VentureBeat, 1.10.2026

Wskaźnik zamiast przewidywania następnego tokena

Decider zdejmuje z Qwen3.5 warstwę przewidującą kolejny token i zastępuje ją małą głowicą, która ocenia każdą dozwoloną opcję odpowiedzi. Agent dostaje nie zdanie do sparsowania, tylko rozkład prawdopodobieństwa na liście wariantów.

Cały model opisują cztery pozycje z karty modelu:

Qwen3.5-2B-Basemodel bazowy
LoRA rank-16adapter, ok. 1 mln parametrów
head.safetensorsgłowica punktująca opcje
Apache-2.0licencja wag i kodu

Znika przy tym cała warstwa pośrednia, którą dziś obudowuje się każde wywołanie modelu językowego: wymuszanie JSON-a, walidacja schematu, ponawianie prośby o poprawny format.

Stan + lista dopuszczalnych opcjiwejście agenta
Jak rozstrzyga warstwa decyzyjna?
LLM
Dekodowanie token po tokeniedziesiątki kroków
Walidacja JSON-a i ponowienieDeny
Decider
Jeden przebieg i punktacja opcjiAllow
Rozkład prawdopodobieństwa na opcjachgotowa decyzja
Pętla decyzji agenta: model językowy kontra model decyzyjny

Takie podejście pokazał we wrześniu TypeSafe AI z modelem Jev, ale tamten pozostał zamknięty i dostępny wyłącznie przez API. Amazon wypuścił wagi, dane i skrypty treningowe, więc wynik da się odtworzyć na własnym sprzęcie.

Liczby bez marketingu

Trafność 72,3 proc. jest użyteczna, ale daleka od pewności — co czwarta decyzja jest błędna. Ciekawsza bywa kalibracja.

Czym jest wynik Briera i dlaczego tu decyduje

Wynik Brier score: Średni kwadrat różnicy między deklarowanym prawdopodobieństwem a tym, co faktycznie się stało. Zero to ideał, 0,25 to poziom rzutu monetą. mierzy nie tyle trafność, ile uczciwość pewności modelu.

…
Znaczenie symboli
…
prawdopodobieństwo zadeklarowane przez model dla i-tej decyzji
…
rzeczywisty wynik: 1 gdy opcja była poprawna, 0 gdy nie
…
liczba ocenianych decyzji

Błąd kalibracji 0,050 oznacza, że deklarowane przez model prawdopodobieństwo odpowiada rzeczywistości, więc próg odcięcia można ustawić świadomie. Na wąskich zadaniach wyniki są wyraźnie lepsze — 0,884 na MuSiQue i 0,872 na ContractNLI.

JSON
{
  "jevbench_public":   { "accuracy": 0.723, "correct": "167/231" },
  "calibration":       { "brier": 0.348, "ece": 0.050 },
  "musique":           { "accuracy": 0.884, "n": 1199 },
  "contractnli":       { "accuracy": 0.872, "n": 1026 },
  "held_out_short":    { "accuracy": 0.641, "n": 6000 }
}

Koszt waży tu tyle samo co jakość. Mediana 106 ms na jednej karcie RTX 3090 oznacza, że decyzje zapadają lokalnie, w pętli agenta, bez odpytywania zewnętrznego API.

Gdzie Decider stoi wobec konkurencji

ModelRozmiarMediana opóźnieniaDostępność
Strands Decider 2B2B106 msApache 2.0, wagi i trening
Clef-flash9B38,8 msApache 2.0 + Workers AI
Clef27B209,3 msApache 2.0 + Workers AI
Jevnieujawniony524,1 mszamknięty, tylko API
Opóźnienia pochodzą z pomiarów producentów na różnym sprzęcie i nie są bezpośrednio porównywalne.

Dlaczego to ważne?

Agenci spędzają sporo czasu na drobnych rozstrzygnięciach: czy wywołać narzędzie, czy dokument jest istotny, czy zamknąć pętlę. Oddawanie ich dużemu modelowi generującemu tekst jest kosztowne i zawodne. Otwarty, skalibrowany model 2B zmienia ekonomikę tej warstwy i podważa sens budowania wokół niej płatnego API.

Co dalej?

  • Amazon nie uruchomił hostowanego API, więc wdrożenie wymaga własnej infrastruktury
  • Wynik 72,3 proc. dotyczy publicznego splitu JevBench, prywatny split nie został opublikowany
  • Nazwa wariantu hobson-v19 w karcie modelu wskazuje na kolejne iteracje adaptera

Źródła

Udostępnij ten artykuł