W petli: 1) percepcja - agent otrzymuje zrzut ekranu (i ew. drzewo dostepnosci/DOM) i interpretuje go modelem wizyjno-jezykowym; 2) rozumowanie/planowanie - decyduje o kolejnym kroku wobec celu; 3) akcja - wykonuje operacje GUI (klik w okreslonych wspolrzednych, wpisanie tekstu, przewijanie, skroty); 4) obserwacja efektu i powtorzenie, az do ukonczenia zadania. Agent czesto dziala w izolowanym srodowisku (VM/przegladarka), moze korzystac z zalogowanych kont uzytkownika i laczyc obsluge GUI z wywolaniami narzedzi/API tam, gdzie sa dostepne.
Automatyzacja zadan na komputerze zwykle wymagala integracji przez API lub kruchych skryptow RPA, ktore lamia sie przy zmianach interfejsu. CUA dziala na warstwie GUI jak czlowiek, wiec moze obsluzyc aplikacje bez API i adaptowac sie do zmian interfejsu.
Analiza zrzutow ekranu (i ew. DOM/drzewa dostepnosci) modelem wizyjno-jezykowym w celu zrozumienia interfejsu.
Decydowanie o kolejnych krokach wobec celu na podstawie stanu ekranu.
Zestaw akcji: klik (wspolrzedne), pisanie, przewijanie, skroty klawiszowe.
Oficjalna
Izolowane srodowisko z przegladarka i systemem plikow, czesto z dostepem do kont uzytkownika.
Oficjalna
CUA dziala z uprawnieniami uzytkownika (zalogowane konta), wiec bledy lub przejecie kontroli moga wyrzadzic realne szkody.
Zlosliwa tresc na stronie moze probowac przejac agenta i sklonic go do niepozadanych dzialan.
Wieloetapowe zadania GUI sa podatne na kumulacje bledow; jeden bledny klik moze wykoleic caly przeplyw.
W pazdzierniku 2024 Anthropic udostepnil funkcje Computer Use, w ktorej Claude steruje komputerem przez zrzuty ekranu i akcje GUI - przelom w upowszechnieniu CUA.
W styczniu 2025 OpenAI wprowadzil agenta Operator opartego na modelu CUA, wykonujacego zadania w przegladarce; Google rozwijal Project Mariner.
Pojawily sie wyspecjalizowane, komercyjne CUA jak Hark Handoff, konkurujace na benchmarkach (Online-Mind2Web) i obnizajace koszt na token.