Andon Labs prowadzi sklep w San Francisco i kawiarnię w Sztokholmie, w których decyzje biznesowe podejmują agenci AI. To nie demo — to metoda pomiaru, którą firma stosuje zamiast benchmarków w symulacji. Wyniki pokazują rozjazd, o którym nie mówi żaden ranking: modele potrafią wykonać zadanie, ale nie potrafią prowadzić firmy.
Najważniejsze w skrócie
- Andon Market: sklep w San Francisco, którym zarządza agentka „Luna”, a ludzie wykonują tylko pracę fizyczną.
- Andon Café w Sztokholmie: model Gemini przepłacał za produkty łatwo psujące się.
- Model OpenAI nadkorygował i zredukował menu kawiarni do tosta z serem.
- Vending-Bench z 2025 roku: symulowany automat i agenci Anthropic, Google oraz OpenAI.
- Firma prowadzi też Blueprint-Bench (rozumienie przestrzeni) i Drone-Bench (kod dla dronów).
Od symulacji do prawdziwej kasy
Vending-Bench był testem w symulacji: agent zarządzał automatem sprzedającym, ustalał ceny i pilnował zapasów. Modele Anthropic, Google i OpenAI po pewnym czasie traciły wątek — pojawiały się luki w pamięci, spadek jakości decyzji i błędy w rozumowaniu etycznym. Andon Labs przeniósł ten sam pomysł do świata fizycznego, bo symulacja wybaczała zbyt wiele.
Luna, kawiarnia i tost z serem
W Andon Market agentka Luna prowadzi korespondencję z dostawcami i pilnuje stanów magazynowych, a zatrudnieni ludzie wykonują pracę fizyczną. Według strony firmy sklepem steruje dziś Claude Fable 5.1, a kawiarnią w Sztokholmie GPT-6 Astra. Każdy model psuł się inaczej. Gemini zamawiało za dużo produktów o krótkim terminie i traciło na odpisach?Odpis (write-off): Spisanie towaru na straty, gdy nie da się go już sprzedać. W gastronomii najczęściej po upływie terminu przydatności.. Model OpenAI wyciągnął wniosek odwrotny i zaczął kasować z menu wszystko, co mogło się zepsuć — aż została jedna pozycja: tost z serem.
| Model | Gdzie | Co poszło nie tak |
|---|---|---|
| Gemini | Andon Café, Sztokholm | zamawianie nadmiaru produktów o krótkim terminie, straty na odpisach |
| Model OpenAI | Andon Café, Sztokholm | nadkorekta — menu skurczone do jednej pozycji |
| Anthropic, Google, OpenAI | Vending-Bench (symulacja) | luki w pamięci, spadek jakości decyzji, błędy w rozumowaniu etycznym |
Niezawodność poprawia się o wiele wolniej niż zdolności.
Sayash Kapoor, badacz z Uniwersytetu Princeton.
Benchmark w symulacji kontra sklep z czynszem
Różnica względem klasycznych benchmarków jest prosta: w teście agent odpowiada na zadanie, w sklepie ponosi konsekwencje przez tygodnie. Żaden leaderboard?Leaderboard: Publiczny ranking modeli według wyniku w benchmarku. Pokazuje pozycję w teście trwającym minuty, nie zachowanie w pracy ciągłej przez tygodnie. nie mierzy drugiego przypadku.
Andon Labs rozbudował portfolio pomiarów i wdrożeń:
Dlaczego to ważne?
Branża mierzy modele testami, które trwają minuty, a sprzedaje je do zadań trwających tygodnie. Kawiarnia z jedną pozycją w menu to zabawna anegdota, ale stojący za nią mechanizm jest poważny: agent optymalizuje jeden wskaźnik i niszczy resztę biznesu. Eksperymenty z prawdziwym czynszem wyłapują takie awarie szybciej niż jakikolwiek ranking.
Co dalej?
- Andon Labs publikuje wyniki porównawcze modeli na Vending-Bench i Blueprint-Bench, więc kolejne premiery będą miały punkt odniesienia poza symulacją.
- Platforma Pion ma pozwolić agentom prowadzić biznesy samodzielnie — to następny stopień, na którym te same tryby awarii wyjdą przy większej skali.





