Amazon opublikował Strands Decider 2B — otwarty model, który zamiast generować tekst punktuje gotowe opcje odpowiedzi. Wagi i kod treningowy trafiły 1 października 2026 na Hugging Face, na licencji Apache 2.0 i bez hostowanego API. To pierwszy darmowy odpowiednik zamkniętego Jeva od TypeSafe AI.
Najważniejsze w skrócie
- Baza to Qwen3.5-2B-Base, a adapter LoRA rank-16 dodaje nieco ponad milion parametrów
- JevBench, split publiczny: 167 poprawnych odpowiedzi na 231 zadań, czyli 72,3 proc.
- Brier 0,348 i błąd kalibracji 0,050 — model zwraca prawdopodobieństwa, nie same etykiety
- Mediana opóźnienia 106 ms na RTX 3090, 296 ms w 95. percentylu
- Trening zamknął się w około 70 minutach na ośmiu H100 albo 11 godzinach na jednym RTX 3090
Wskaźnik zamiast przewidywania następnego tokena
Decider zdejmuje z Qwen3.5 warstwę przewidującą kolejny token i zastępuje ją małą głowicą, która ocenia każdą dozwoloną opcję odpowiedzi. Agent dostaje nie zdanie do sparsowania, tylko rozkład prawdopodobieństwa na liście wariantów.
Cały model opisują cztery pozycje z karty modelu:
Znika przy tym cała warstwa pośrednia, którą dziś obudowuje się każde wywołanie modelu językowego: wymuszanie JSON-a, walidacja schematu, ponawianie prośby o poprawny format.
Takie podejście pokazał we wrześniu TypeSafe AI z modelem Jev, ale tamten pozostał zamknięty i dostępny wyłącznie przez API. Amazon wypuścił wagi, dane i skrypty treningowe, więc wynik da się odtworzyć na własnym sprzęcie.
Liczby bez marketingu
Trafność 72,3 proc. jest użyteczna, ale daleka od pewności — co czwarta decyzja jest błędna. Ciekawsza bywa kalibracja.
Czym jest wynik Briera i dlaczego tu decyduje
Wynik Briera?Brier score: Średni kwadrat różnicy między deklarowanym prawdopodobieństwem a tym, co faktycznie się stało. Zero to ideał, 0,25 to poziom rzutu monetą. mierzy nie tyle trafność, ile uczciwość pewności modelu.
Znaczenie symboli
- …
- prawdopodobieństwo zadeklarowane przez model dla i-tej decyzji
- …
- rzeczywisty wynik: 1 gdy opcja była poprawna, 0 gdy nie
- …
- liczba ocenianych decyzji
Błąd kalibracji 0,050 oznacza, że deklarowane przez model prawdopodobieństwo odpowiada rzeczywistości, więc próg odcięcia można ustawić świadomie. Na wąskich zadaniach wyniki są wyraźnie lepsze — 0,884 na MuSiQue i 0,872 na ContractNLI.
{
"jevbench_public": { "accuracy": 0.723, "correct": "167/231" },
"calibration": { "brier": 0.348, "ece": 0.050 },
"musique": { "accuracy": 0.884, "n": 1199 },
"contractnli": { "accuracy": 0.872, "n": 1026 },
"held_out_short": { "accuracy": 0.641, "n": 6000 }
}Koszt waży tu tyle samo co jakość. Mediana 106 ms na jednej karcie RTX 3090 oznacza, że decyzje zapadają lokalnie, w pętli agenta, bez odpytywania zewnętrznego API.
Gdzie Decider stoi wobec konkurencji
| Model | Rozmiar | Mediana opóźnienia | Dostępność |
|---|---|---|---|
| Strands Decider 2B | 2B | 106 ms | Apache 2.0, wagi i trening |
| Clef-flash | 9B | 38,8 ms | Apache 2.0 + Workers AI |
| Clef | 27B | 209,3 ms | Apache 2.0 + Workers AI |
| Jev | nieujawniony | 524,1 ms | zamknięty, tylko API |
Dlaczego to ważne?
Agenci spędzają sporo czasu na drobnych rozstrzygnięciach: czy wywołać narzędzie, czy dokument jest istotny, czy zamknąć pętlę. Oddawanie ich dużemu modelowi generującemu tekst jest kosztowne i zawodne. Otwarty, skalibrowany model 2B zmienia ekonomikę tej warstwy i podważa sens budowania wokół niej płatnego API.
Co dalej?
- Amazon nie uruchomił hostowanego API, więc wdrożenie wymaga własnej infrastruktury
- Wynik 72,3 proc. dotyczy publicznego splitu JevBench, prywatny split nie został opublikowany
- Nazwa wariantu
hobson-v19w karcie modelu wskazuje na kolejne iteracje adaptera
Źródła
- VentureBeat — Amazon unveils a free, fast, open source Jev killer: Strands Decider 2B makes decisions in fractions of a second
- Hugging Face — StrandsAgents/strands-decider-2B-hobson-v19
- Strands Agents — Strands Agents SDK





