OSWorld
Jak działa
Każde zadanie OSWorld działa w maszynie wirtualnej z realnym systemem operacyjnym (Ubuntu, Windows lub macOS), uruchamianej przez dostawców wirtualizacji/chmury (m.in. VMware, VirtualBox, Docker, AWS). Na początku zadania środowisko jest ustawiane do zdefiniowanego stanu początkowego, a agent otrzymuje instrukcję w języku naturalnym wraz z obserwacją (zrzut ekranu i opcjonalnie drzewo dostępności). Agent generuje akcje niskiego poziomu (ruchy i kliknięcia myszą, wpisywanie tekstu, skróty klawiszowe), które są wykonywane w maszynie. Po zakończeniu uruchamiany jest dedykowany, wykonywalny skrypt ewaluacyjny (benchmark zawiera zestaw funkcji ewaluacyjnych), który sprawdza realny stan końcowy — pliki, zawartość aplikacji, konfigurację — i przyznaje wynik sukces/porażka. Dzięki temu ocena jest powtarzalna i odporna na powierzchowne dopasowanie tekstu.
Rozwiązany problem
Wcześniejsze benchmarki dla agentów operujących na komputerze ograniczały się do wąskich, uproszczonych lub symulowanych środowisk (np. pojedyncza aplikacja czy uproszczona strona WWW), co nie oddawało złożoności realnej pracy w systemie operacyjnym i utrudniało rzetelną, powtarzalną ocenę. OSWorld rozwiązuje ten problem, udostępniając realne środowiska OS z wieloma aplikacjami oraz automatyczną, wykonywalną weryfikację wyniku.
Komponenty
Maszyna wirtualna z realnym systemem (Ubuntu, Windows, macOS), w której agent wykonuje akcje. Uruchamiana przez dostawców takich jak VMware, VirtualBox, Docker czy AWS.
369 zadań komputerowych opartych na realnych aplikacjach webowych i desktopowych, każde ze zdefiniowaną instrukcją w języku naturalnym i stanem początkowym.
Skrypty sprawdzające realny stan końcowy systemu po wykonaniu zadania (pliki, zawartość aplikacji, konfigurację) i przyznające wynik sukces/porażka, zamiast dopasowania tekstu.
Implementacja
Część oryginalnych wykonywalnych funkcji ewaluacyjnych zawierała błędy wychwycone przez społeczność, co mogło zaniżać lub zawyżać wyniki — adresuje to późniejsza wersja OSWorld-Verified.
Ewolucja
Pierwsza wersja benchmarku z 369 realnymi zadaniami w Ubuntu, Windows i macOS oraz wykonywalną weryfikacją wyniku.
OSWorld zostaje zaprezentowany na konferencji NeurIPS 2024 jako benchmark dla agentów computer-use.
Ulepszona wersja (ogłoszona 28 lipca 2025) poprawiająca zgłoszone przez społeczność błędne przykłady i skracająca czas ewaluacji dzięki wsparciu AWS.