Deweloper przekazuje w żądaniu API poziom wysiłku (np. low/medium/high) lub budżet tokenów myślenia. Model steruje długością wewnętrznego łańcucha rozumowania: przy niskim wysiłku generuje krótki ślad myślenia (lub pomija go), przy wysokim — dłuższy, co daje więcej kroków wnioskowania, autoweryfikacji i eksploracji rozwiązań przed wyjściem. Ponieważ tokeny myślenia są generowane autoregresyjnie i zwykle płatne, wyższy wysiłek wprost zwiększa latencję i koszt. Konkretne semantyki (dyskretne poziomy vs. budżet tokenów, czy myślenie jest widoczne) różnią się między dostawcami.
Modele rozumujące osiągają lepsze wyniki, gdy 'myślą dłużej', ale stała, maksymalna ilość rozumowania jest wolna i droga dla prostych zapytań. Reasoning Effort rozwiązuje problem braku kontroli nad kompromisem koszt/latencja/jakość, oddając go w ręce dewelopera per żądanie.
Pole żądania API (np. reasoning_effort = low/medium/high) lub budżet tokenów myślenia sterujące ilością rozumowania.
Mechanizm modelu generujący wewnętrzne tokeny myślenia, którego długość skalowana jest zgodnie z zadanym wysiłkiem.
Wysoki wysiłek na prostych zapytaniach marnuje czas i tokeny bez poprawy jakości.
Tokeny myślenia są zwykle płatne i wydłużają odpowiedź; wysoki wysiłek może wielokrotnie zwiększyć koszt.
Dyskretne poziomy vs. budżet tokenów, różne wartości domyślne i widoczność myślenia utrudniają przenośność.
Modele o1 wprowadzają test-time compute jako sterowalny wysiłek rozumowania w API.
Claude udostępnia budżet tokenów myślenia jako ciągłą kontrolę wysiłku.
Rozszerzenie skali wysiłku o najtańszy tryb minimalnego rozumowania.
Gemini udostępnia dyskretne poziomy myślenia (low/high) obok wcześniejszego budżetu.
Złożoność czasowa: O(b).
Wewnętrzny łańcuch rozumowania jest generowany autoregresyjnie token po tokenie, co czyni latencję głównym ograniczeniem przy wysokim wysiłku.
Dyskretny poziom wysiłku rozumowania.
Alternatywna, ciągła kontrola: maksymalna liczba tokenów przeznaczona na wewnętrzne myślenie (np. Anthropic budget_tokens, Gemini thinking budget).
Ilość obliczeń zależy od zadanego wysiłku (a przy myśleniu adaptacyjnym — od trudności zapytania).
Dłuższe myślenie to dłuższa sekwencja tokenów generowana szeregowo; równoległość dotyczy raczej wariantu 'parallel test-time compute' (wiele przebiegów naraz), nie pojedynczego łańcucha.
Generowanie długich śladów myślenia to intensywne dekodowanie LLM na GPU.
Modele rozumujące wnioskowane także na TPU (np. Gemini).
To parametr sterujący, niezależny od konkretnego sprzętu.