VentureBeat opisał 7 września 2026 problem, który dorobił się już własnej nazwy: tokenmaxxing, czyli gwałtowny wzrost zużycia tokenów bez ROI, który by go uzasadniał. Problem w tym, że prawie nikt nie potrafi wykazać, co z tych wydatków wynika.
Najważniejsze w skrócie
- Prognoza Gartnera: 207 mld USD na oprogramowanie agentowe w 2026, wzrost o 139%
- Uber wyczerpał roczny budżet na kodowanie AI do kwietnia 2026, cztery miesiące po wdrożeniu
- Nowy limit w Uberze: 1500 USD miesięcznie na pracownika
- Everlaw: projekt za 3500 USD tokenów skrócił wdrożenie z 9,5 do 2,5 osobomiesiąca
- Warstwy routingu oferują już Databricks, Amazon Bedrock, Azure AI Foundry i Merge
Uber wyczerpał roczny budżet w cztery miesiące
Uber udostępnił Claude Code inżynierom w grudniu 2025. Do kwietnia 2026 cały roczny budżet na kodowanie AI był wyczerpany. Zużycie tokenów rosło, ale nie dało się go powiązać z lepszym produktem.
Nie ma jeszcze związku między tym rozdmuchanym zużyciem a dostarczaniem faktycznie lepszych produktów.
Andrew Macdonald, prezes i dyrektor operacyjny Ubera.
Everlaw pokazuje drugą stronę
Kontrprzykładem jest Everlaw, gdzie rachunek daje się domknąć. Max Christoff, dyrektor techniczny, podaje projekt infrastruktury w Javie: wydanie 3500 USD na tokeny skróciło wdrożenie z 9,5 do 2,5 osobomiesiąca?Osobomiesiąc: Jednostka pracochłonności: praca jednego inżyniera przez jeden miesiąc. Pozwala porównywać projekty o różnej wielkości zespołu.. Przy większym produkcie koszt sięgnął 27–40 tys. USD, ale zakres pracy spadł z 90–100 osobomiesięcy do 19.
| Wymiar | Uber | Everlaw |
|---|---|---|
| Zakres | firmowe wdrożenie od grudnia 2025 | pojedyncze projekty inżynierskie |
| Punkt odniesienia ustalony z góry | nie | tak |
| Koszt tokenów | roczny budżet wyczerpany do kwietnia 2026 | 3500 USD oraz 27–40 tys. USD |
| Wynik | brak wykazanego związku z jakością produktu | 9,5 → 2,5 i 90–100 → 19 osobomiesięcy |
| Reakcja | limit 1500 USD na pracownika miesięcznie | — |
Różnica nie leży w narzędziu, tylko w tym, że ktoś z góry określił punkt odniesienia. Bez niego rachunek za tokeny jest nierozstrzygalny.
Znaczenie symboli
- …
- realna oszczędność projektu
- …
- szacowany koszt zadania bez AI, ustalony przed startem prac
- …
- rachunek za zużyte tokeny
- …
- koszt pozostałej pracy inżynierów
Warstwa routingu jako odpowiedź
Najczęściej proponowanym rozwiązaniem jest routing modeli — dobieranie modelu i harnessu do zadania, zamiast puszczania wszystkiego przez najdroższy dostępny.
Jak działa warstwa routingu
Databricks wprowadził Smart Routing w Unity AI Gateway, z zapowiedzią automatycznego doboru modelu i harnessu do każdego zadania kodowania. Podobne mechanizmy mają Amazon Bedrock i Azure AI Foundry, a na rynku działa też Merge.
Dlaczego to ważne?
Uber i Everlaw używały tych samych narzędzi i doszły do przeciwnych wniosków, bo tylko jedna z tych firm ustaliła wcześniej, ile dane zadanie kosztowałoby bez AI.
Przy prognozie 207 mld USD to przestaje być kwestią higieny finansowej, a staje się warunkiem utrzymania budżetów w kolejnym roku.
Co dalej?
- Limit 1500 USD na pracownika w Uberze jest twardym testem — pokaże, czy ograniczenie zużycia obniży jakość, czy tylko rachunek
- Prognoza Gartnera zakłada wzrost o 139% rok do roku, więc presja na wykazanie zwrotu narasta szybciej niż same wydatki
- Żaden z opisanych dostawców routingu nie publikuje jeszcze porównywalnych danych o realnych oszczędnościach u klientów
Źródła
- VentureBeat — Companies are spending millions rewiring how AI gets used. Almost none can prove it's working
- Databricks Documentation — Route coding tasks with Smart Routing





