Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Andon Labs oddaje firmy agentom AI. Menu spadło do tosta z serem

Pan Robocik20 września 2026 · 3 min czytania
Andon Labs oddaje firmy agentom AI. Menu spadło do tosta z serem

Andon Labs prowadzi sklep w San Francisco i kawiarnię w Sztokholmie, w których decyzje biznesowe podejmują agenci AI. To nie demo — to metoda pomiaru, którą firma stosuje zamiast benchmarków w symulacji. Wyniki pokazują rozjazd, o którym nie mówi żaden ranking: modele potrafią wykonać zadanie, ale nie potrafią prowadzić firmy.

Najważniejsze w skrócie

  • Andon Market: sklep w San Francisco, którym zarządza agentka „Luna”, a ludzie wykonują tylko pracę fizyczną.
  • Andon Café w Sztokholmie: model Gemini przepłacał za produkty łatwo psujące się.
  • Model OpenAI nadkorygował i zredukował menu kawiarni do tosta z serem.
  • Vending-Bench z 2025 roku: symulowany automat i agenci Anthropic, Google oraz OpenAI.
  • Firma prowadzi też Blueprint-Bench (rozumienie przestrzeni) i Drone-Bench (kod dla dronów).
1tyle pozycji zostało w menu kawiarni, gdy model zaczął usuwać wszystko, co może się zepsućAndon Labs / IEEE Spectrum

Od symulacji do prawdziwej kasy

Vending-Bench był testem w symulacji: agent zarządzał automatem sprzedającym, ustalał ceny i pilnował zapasów. Modele Anthropic, Google i OpenAI po pewnym czasie traciły wątek — pojawiały się luki w pamięci, spadek jakości decyzji i błędy w rozumowaniu etycznym. Andon Labs przeniósł ten sam pomysł do świata fizycznego, bo symulacja wybaczała zbyt wiele.

Luna, kawiarnia i tost z serem

W Andon Market agentka Luna prowadzi korespondencję z dostawcami i pilnuje stanów magazynowych, a zatrudnieni ludzie wykonują pracę fizyczną. Według strony firmy sklepem steruje dziś Claude Fable 5.1, a kawiarnią w Sztokholmie GPT-6 Astra. Każdy model psuł się inaczej. Gemini zamawiało za dużo produktów o krótkim terminie i traciło na Odpis (write-off): Spisanie towaru na straty, gdy nie da się go już sprzedać. W gastronomii najczęściej po upływie terminu przydatności.. Model OpenAI wyciągnął wniosek odwrotny i zaczął kasować z menu wszystko, co mogło się zepsuć — aż została jedna pozycja: tost z serem.

ModelGdzieCo poszło nie tak
GeminiAndon Café, Sztokholmzamawianie nadmiaru produktów o krótkim terminie, straty na odpisach
Model OpenAIAndon Café, Sztokholmnadkorekta — menu skurczone do jednej pozycji
Anthropic, Google, OpenAIVending-Bench (symulacja)luki w pamięci, spadek jakości decyzji, błędy w rozumowaniu etycznym
Ten sam typ zadania, trzy różne tryby awarii.
Niezawodność poprawia się o wiele wolniej niż zdolności.

Sayash Kapoor, badacz z Uniwersytetu Princeton.

Benchmark w symulacji kontra sklep z czynszem

Różnica względem klasycznych benchmarków jest prosta: w teście agent odpowiada na zadanie, w sklepie ponosi konsekwencje przez tygodnie. Żaden Leaderboard: Publiczny ranking modeli według wyniku w benchmarku. Pokazuje pozycję w teście trwającym minuty, nie zachowanie w pracy ciągłej przez tygodnie. nie mierzy drugiego przypadku.

Andon Labs rozbudował portfolio pomiarów i wdrożeń:

Vending-Benchsymulowany automat sprzedający, wersja z 2025 roku
Blueprint-Benchrozumienie przestrzeni
Drone-Benchpisanie kodu dla dronów
Andon FMcztery stacje radiowe prowadzone przez agentów
Pionplatforma, na której agenci mają samodzielnie prowadzić biznesy

Dlaczego to ważne?

Branża mierzy modele testami, które trwają minuty, a sprzedaje je do zadań trwających tygodnie. Kawiarnia z jedną pozycją w menu to zabawna anegdota, ale stojący za nią mechanizm jest poważny: agent optymalizuje jeden wskaźnik i niszczy resztę biznesu. Eksperymenty z prawdziwym czynszem wyłapują takie awarie szybciej niż jakikolwiek ranking.

Co dalej?

  • Andon Labs publikuje wyniki porównawcze modeli na Vending-Bench i Blueprint-Bench, więc kolejne premiery będą miały punkt odniesienia poza symulacją.
  • Platforma Pion ma pozwolić agentom prowadzić biznesy samodzielnie — to następny stopień, na którym te same tryby awarii wyjdą przy większej skali.

Źródła

Udostępnij ten artykuł