Zadania są zbierane z realnych sesji Cursora (m.in. z wewnętrznej bazy kodu i kontrolowanych źródeł), a mechanizm Cursor Blame pozwala prześledzić scommitowany kod z powrotem do prośby agenta, która go wygenerowała. Ewaluacja przebiega w trybie hybrydowym online-offline: benchmark offline uzupełniany jest kontrolowaną analizą ruchu na żywo. Ponieważ zadania bywają niedookreślone, do punktowania wykorzystywane są agentowe gradery. Dla każdego modelu raportowane są wynik, koszt na zadanie (liczony z zużycia tokenów i cennika za milion tokenów: wejście, odczyt/zapis cache, wyjście) oraz liczba kroków. Wyniki podlegają wariancji, więc małe różnice mogą nie być istotne statystycznie.
Standardowe benchmarki kodowania oceniają modele na wyizolowanych, dobrze zdefiniowanych zadaniach, które słabo odzwierciedlają codzienną pracę w IDE: wieloplikowe, niejednoznaczne prośby, gdzie liczy się nie tylko poprawność, ale i jakość kodu oraz efektywność. CursorBench ma mierzyć realną użyteczność agenta w takich warunkach.
Zadania pochodzące z realnych sesji Cursor IDE, m.in. z wewnętrznej bazy kodu i kontrolowanych źródeł; odświeżane co kilka miesięcy.
Gradery agentowe wykorzystywane do wiarygodnego oceniania rozwiązań mimo niejednoznaczności próśb.
Mechanizm śledzący scommitowany kod z powrotem do prośby agenta, która go wytworzyła.
Wyniki podlegają wariancji; małe różnice w punktacji mogą nie być istotne statystycznie.
CursorBench to wewnętrzny zestaw Anysphere oparty częściowo na prywatnej bazie kodu; nie jest w pełni odtwarzalny przez podmioty zewnętrzne.
Wpis na blogu Cursora „How we compare model quality in Cursor” (11 marca 2026, Naman Jain) opisuje CursorBench jako wewnętrzny zestaw ewaluacyjny oparty na realnych sesjach.
Aktualizacja zestawu ewaluacyjnego (maj 2026).
Rozszerzenie o typy zadań: edit, refactor, investigation, intent understanding, managing jobs i design adherence (10 września 2026).