Agent dostaje polecenie sformułowane tak, jak zrobiłby to partner w kancelarii, oraz dostęp do systemu plików odwzorowującego realne środowisko pracy: dokumenty sprawy klienckiej, wirtualne data roomy, szablony i materiały tła. Do dyspozycji ma narzędzia do pracy z dokumentami, arkuszami kalkulacyjnymi, prezentacjami i systemem plików. Efektem ma być produkt gotowy do przeglądu przez partnera lub klienta. Ocena opiera się na rozbudowanej rubryce — ponad 75 tysięcy kryteriów napisanych przez ekspertów — ale kluczowa jest reguła agregacji: standard all-pass wymaga spełnienia każdego kryterium, żeby zadanie zaliczyć. Daje to wyniki znacznie niższe niż punktacja kryterium po kryterium stosowana w BigLaw Bench, za to bliższe realnym wymaganiom praktyki. Harvey udostępnia zbiór danych wraz z harnessem wykonawczym na otwartej licencji.
Wcześniejsze benchmarki prawnicze mierzyły krótkie rozumowanie na pojedynczym dokumencie, co nie oddaje pracy, w której trzeba przejrzeć pakiet materiałów, wydobyć z nich istotne wątki i wytworzyć gotowy dokument. LAB przenosi ocenę na poziom pełnego produktu pracy i długiego horyzontu zadania.
Obejmuje pracę transakcyjną, doradczą, regulacyjną i procesową, osadzoną w syntetycznych sprawach klienckich.
Kryteria napisane przez ekspertów, rozpisane szczegółowo dla każdego zadania.
Jedno niespełnione kryterium przekreśla całe zadanie — brak ocen częściowych.
Dokumenty sprawy, wirtualne data roomy, szablony i materiały tła dostępne przez narzędzia systemu plików.
Standard all-pass sprawia, że nawet mocne modele uzyskują kilkanaście do dwudziestu kilku procent — porównywanie tych liczb z benchmarkami punktowanymi kryterium po kryterium wprowadza w błąd.
Zadania osadzone są w syntetycznych sprawach klienckich, co eliminuje problemy poufności, ale nie oddaje pełnego bałaganu prawdziwych akt.
Harvey publikuje w sierpniu 2024 roku BigLaw Bench, oceniający krótkie zadania prawnicze kryterium po kryterium.
W lutym 2026 pojawia się wariant Global obejmujący jurysdykcje międzynarodowe, a w marcu 2026 wariant Research dotyczący wyszukiwania orzecznictwa.
6 maja 2026 Harvey udostępnia LAB: 1250+ zadań, 24 dziedziny praktyki, 75 tys. kryteriów i standard all-pass, jako projekt otwartoźródłowy bez leaderboardu.