Robocikowo>ROBOCIKOWO
Ocena jakości

OSWorld

2024AktywnyOpublikowano: 1 października 2026Aktualizacja: 1 października 2026Opublikowany
OSWorld to benchmark do oceny multimodalnych agentów typu computer-use, wykonujących 369 realnych zadań w pełnych systemach operacyjnych z weryfikacją opartą na wykonaniu.
Kluczowa innowacja
Przeniesienie ewaluacji agentów typu computer-use z uproszczonych, odizolowanych środowisk do pełnych, realnych systemów operacyjnych (Ubuntu, Windows, macOS) z weryfikacją wyniku opartą na faktycznym wykonaniu zadania.
Kategoria
Ocena jakości
Poziom abstrakcji
Benchmark
Poziom operacji
Ewaluacja (runtime)Środowisko agentowe
Zastosowania
Ewaluacja agentów typu computer-useTestowanie multimodalnych agentów GUIPomiar zdolności GUI groundingBadania nad agentami autonomicznie obsługującymi system operacyjnyPorównywanie modeli na realnych zadaniach desktopowych i webowych

Jak działa

Każde zadanie OSWorld działa w maszynie wirtualnej z realnym systemem operacyjnym (Ubuntu, Windows lub macOS), uruchamianej przez dostawców wirtualizacji/chmury (m.in. VMware, VirtualBox, Docker, AWS). Na początku zadania środowisko jest ustawiane do zdefiniowanego stanu początkowego, a agent otrzymuje instrukcję w języku naturalnym wraz z obserwacją (zrzut ekranu i opcjonalnie drzewo dostępności). Agent generuje akcje niskiego poziomu (ruchy i kliknięcia myszą, wpisywanie tekstu, skróty klawiszowe), które są wykonywane w maszynie. Po zakończeniu uruchamiany jest dedykowany, wykonywalny skrypt ewaluacyjny (benchmark zawiera zestaw funkcji ewaluacyjnych), który sprawdza realny stan końcowy — pliki, zawartość aplikacji, konfigurację — i przyznaje wynik sukces/porażka. Dzięki temu ocena jest powtarzalna i odporna na powierzchowne dopasowanie tekstu.

Rozwiązany problem

Wcześniejsze benchmarki dla agentów operujących na komputerze ograniczały się do wąskich, uproszczonych lub symulowanych środowisk (np. pojedyncza aplikacja czy uproszczona strona WWW), co nie oddawało złożoności realnej pracy w systemie operacyjnym i utrudniało rzetelną, powtarzalną ocenę. OSWorld rozwiązuje ten problem, udostępniając realne środowiska OS z wieloma aplikacjami oraz automatyczną, wykonywalną weryfikację wyniku.

Komponenty

Środowisko systemu operacyjnego (VM)Środowisko wykonawcze zadań

Maszyna wirtualna z realnym systemem (Ubuntu, Windows, macOS), w której agent wykonuje akcje. Uruchamiana przez dostawców takich jak VMware, VirtualBox, Docker czy AWS.

Zestaw zadańZbiór zadań ewaluacyjnych

369 zadań komputerowych opartych na realnych aplikacjach webowych i desktopowych, każde ze zdefiniowaną instrukcją w języku naturalnym i stanem początkowym.

Wykonywalne funkcje ewaluacyjneAutomatyczna, powtarzalna weryfikacja wyniku

Skrypty sprawdzające realny stan końcowy systemu po wykonaniu zadania (pliki, zawartość aplikacji, konfigurację) i przyznające wynik sukces/porażka, zamiast dopasowania tekstu.

Implementacja

Pułapki implementacyjne
Zawodność części funkcji ewaluacyjnychŚrednia

Część oryginalnych wykonywalnych funkcji ewaluacyjnych zawierała błędy wychwycone przez społeczność, co mogło zaniżać lub zawyżać wyniki — adresuje to późniejsza wersja OSWorld-Verified.

Rozwiązanie:Korzystanie z wersji OSWorld-Verified i najnowszych poprawek skryptów ewaluacyjnych.

Ewolucja

Oryginalny paper · 2024 · NeurIPS 2024 · Tianbao Xie
OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments
Tianbao Xie, Danyang Zhang, Jixuan Chen, Xiaochuan Li, Siheng Zhao, Ruisheng Cao, Toh Jing Hua, Zhoujun Cheng, Dongchan Shin, Fangyu Lei, Yitao Liu, Yiheng Xu, Shuyan Zhou, Silvio Savarese, Caiming Xiong, Victor Zhong, Tao Yu
2024
Publikacja OSWorld (arXiv)
Punkt przełomowy

Pierwsza wersja benchmarku z 369 realnymi zadaniami w Ubuntu, Windows i macOS oraz wykonywalną weryfikacją wyniku.

2024
Prezentacja na NeurIPS 2024

OSWorld zostaje zaprezentowany na konferencji NeurIPS 2024 jako benchmark dla agentów computer-use.

2025
OSWorld-Verified

Ulepszona wersja (ogłoszona 28 lipca 2025) poprawiająca zgłoszone przez społeczność błędne przykłady i skracająca czas ewaluacji dzięki wsparciu AWS.