Sędziemu-LLM przekazuje się prompt ewaluacyjny składający się z: (1) instrukcji roli i kryteriów oceny (rubryki), (2) kontekstu — pytania lub zadania, (3) ocenianej odpowiedzi (lub dwóch odpowiedzi przy trybie parami), oraz opcjonalnie (4) odpowiedzi wzorcowej. Model najpierw generuje uzasadnienie (rozumowanie krok po kroku, chain-of-thought), a dopiero potem wystawia werdykt — liczbę w małej skali całkowitej (np. 1–5), etykietę zwycięzcy (A/B/remis) lub ocenę według rubryki addytywnej. Wynik jest zwykle wymuszany w strukturze (np. JSON), aby był parsowalny. Aby ograniczyć obciążenia, stosuje się zamianę pozycji odpowiedzi i uśrednianie (bias pozycyjny), normalizację długości (bias wielosłowności), użycie innego modelu niż oceniany (bias autopromocji) oraz ocenę względem odpowiedzi referencyjnej dla zadań wymagających precyzji. Wyniki wielu sędziów lub wielu przebiegów można agregować (panel sędziów, głosowanie).
Ocena jakości otwartych odpowiedzi generatywnych jest trudna: metryki leksykalne (BLEU, ROUGE) słabo korelują z preferencjami ludzi, a rzetelna ocena ludzka jest wolna, kosztowna i trudna do skalowania. LLM-as-a-Judge dostarcza automatycznej, szybkiej i tanie oceny, która przy silnym modelu-sędzim osiąga wysoką zgodność z ludzkimi ocenami i skaluje się do tysięcy porównań.
Silny model językowy (np. GPT-4, Claude, Prometheus) generujący ocenę. Jego zdolności rozumowania decydują o wiarygodności ewaluacji.
Oficjalna
Instrukcja definiująca kryteria oceny, skalę i format wyjścia. Może zawierać rubrykę addytywną i przykłady few-shot.
Wybór trybu: punktowy (pointwise), porównanie parami (pairwise) lub względem odpowiedzi referencyjnej (reference-guided).
Oficjalna
Kroki rozumowania generowane przed werdyktem. Poprawiają jakość i przejrzystość oceny (paradygmat G-Eval: CoT + form-filling).
Oficjalna
Techniki zwiększające rzetelność: zamiana pozycji i uśrednianie, panel sędziów, głosowanie, normalizacja długości.
Oficjalna
W trybie parami sędzia często faworyzuje odpowiedź na pierwszej (lub drugiej) pozycji niezależnie od jakości.
Sędzia bywa stronniczy wobec dłuższych, bardziej rozbudowanych odpowiedzi, nawet gdy nie są lepsze.
Model-sędzia może faworyzować odpowiedzi wygenerowane przez samego siebie lub przez modele z tej samej rodziny.
Sędzia może błędnie oceniać zadania wymagające precyzyjnego rozumowania (matematyka, logika), zawyżając błędne odpowiedzi.
Oceny bezwzględne na szerokiej skali (0–10) są mniej stabilne i słabiej korelują z ludźmi.
Małe zmiany promptu lub temperatura > 0 zmieniają werdykty i utrudniają powtarzalność.
Anthropic pokazuje, że model AI może generować etykiety preferencji i informację zwrotną do alignmentu (RLAIF), co jest bezpośrednim prekursorem użycia LLM jako oceniającego.
„G-Eval" wykorzystuje GPT-4 z łańcuchem rozumowania i formularzem oceny, uzyskując lepszą korelację z ludźmi niż metryki leksykalne w zadaniach NLG.
Zheng i in. wprowadzają MT-Bench i Chatbot Arena, wykazując ponad 80% zgodności GPT-4 z ludźmi oraz systematyzując bias pozycyjny, wielosłowności i autopromocji.
Prometheus (ICLR 2024) to otwarty model 13B trenowany na Feedback Collection, oceniający według własnych rubryk i dorównujący korelacji GPT-4, co uniezależnia ewaluację od modeli zamkniętych.
LLM-as-a-Judge staje się standardem w AlpacaEval, Arena-Hard, ewaluacji RAG (RAGAS) oraz jako źródło danych preferencyjnych w RLAIF i DPO.
Złożoność czasowa: O(N · L² · d). Złożoność przestrzenna: O(L · d).
Każda ocena wymaga wywołania dużego modelu; przy silnych sędziach (GPT-4) koszt i opóźnienie na jedno porównanie są wysokie, a w trybie parami skalują się kwadratowo.
Który LLM pełni rolę sędziego. Silniejszy model to wyższa zgodność z ludźmi, ale większy koszt; ważne, by nie był to model oceniany (bias autopromocji).
Pointwise (skala liczbowa), pairwise (porównanie dwóch odpowiedzi) lub reference-guided. Wpływa na stabilność i podatność na bias pozycyjny.
Zakres skali punktowej. Małe skale całkowite (1–4 lub 1–5) dają wyższą korelację z ludźmi niż ciągłe 0–10.
Czy model generuje uzasadnienie przed werdyktem. Wyraźnie poprawia korelację (paradygmat G-Eval).
Dołączenie odpowiedzi wzorcowej. Poprawia ocenę zadań wymagających precyzji (matematyka, fakty).
W trybie parami: ocena obu kolejności (A,B) i (B,A) oraz uśrednienie, aby zneutralizować bias pozycyjny.
Zwykle ustawiana na 0 dla powtarzalności i determinizmu ocen.
Wzorzec na poziomie inferencji/ewaluacji korzystający z pełnego, gęstego przebiegu modelu-sędziego; sam nie wprowadza routingu (choć wariant „panelu sędziów” może kierować przypadki do różnych modeli).
Poszczególne oceny są niezależne (embarrassingly parallel) i można je rozproszyć wsadowo na wielu urządzeniach; sekwencyjna pozostaje tylko generacja w obrębie jednej oceny.
To wzorzec ewaluacji na poziomie inferencji — działa na dowolnym sprzęcie (lub przez API) zdolnym uruchomić model-sędzia.
Lokalne uruchamianie dużych sędziów (np. Prometheus) i masowa, wsadowa ewaluacja korzystają z GPU o dużej przepustowości i pamięci.