1) Tekst kandydujący i referencyjny są tokenizowane (opcjonalnie ze stemmingiem i usuwaniem stop-słów). 2) Wyznaczany jest najdłuższy wspólny podciąg (LCS) — najdłuższa sekwencja tokenów występujących w obu tekstach w tej samej kolejności, ale niekoniecznie sąsiadująco; oblicza się go programowaniem dynamicznym w czasie O(m·n). 3) Liczy się recall R_lcs = LCS/m (m = długość referencji) i precision P_lcs = LCS/n (n = długość kandydata). 4) Wynik to F-miara: F_lcs = (1+β²)·R_lcs·P_lcs / (R_lcs + β²·P_lcs), gdzie β = P_lcs/R_lcs kontroluje wagę recall względem precision. 5) Dla poziomu podsumowań (ROUGE-Lsum) LCS liczy się per para zdań i sumuje (union LCS), co uwzględnia strukturę zdaniową całego streszczenia.
Metryki oparte na n-gramach o stałej długości (jak ROUGE-N czy BLEU) karzą poprawne parafrazy z inną kolejnością słów i wymagają arbitralnego wyboru długości n-gramu. ROUGE-L rozwiązuje to, mierząc najdłuższą wspólną sekwencję zachowującą kolejność, bez wymogu ciągłości i bez ustalania długości n-gramu.
Programowanie dynamiczne wyznaczające najdłuższą wspólną sekwencję tokenów zachowującą kolejność, bez wymogu ciągłości.
Łączy recall i precision LCS w jedną F-miarę ważoną parametrem beta.
Agregacja LCS na poziomie całego streszczenia jako suma LCS par zdań; wrażliwa na podział na zdania.
Oficjalna
Wartości ROUGE-L (zdaniowy) i ROUGE-Lsum (poziom podsumowań, z podziałem na zdania) różnią się; raportowanie bez wskazania wariantu prowadzi do nieporównywalnych wyników.
Różne biblioteki (Perl ROUGE 1.5.5, rouge-score, pyrouge) dają różne wyniki przez odmienną tokenizację, stemming i usuwanie stop-słów.
ROUGE-L mierzy jedynie leksykalne pokrycie i kolejność; poprawne parafrazy z innymi słowami są niedoceniane.
Chin-Yew Lin definiuje pakiet ROUGE, w tym ROUGE-L oparty na LCS, na warsztacie Text Summarization Branches Out.
ROUGE staje się standardową metryką ewaluacji na konferencjach Document Understanding Conference.
Modele takie jak pointer-generator (See i in., 2017) raportują ROUGE-1/2/L jako główną metrykę.
Prace jak PEGASUS (Zhang i in., 2020) raportują ROUGE-Lsum, popularyzując implementację google-research/rouge-score.
Złożoność czasowa: O(m · n). Złożoność przestrzenna: O(m · n).
Koszt zdominowany przez wypełnienie tablicy DP o rozmiarze m×n dla każdej pary kandydat-referencja; pomijalny dla typowych długości tekstów.
Parametr β w F-mierze; w oryginalnym ROUGE β=P_lcs/R_lcs, silnie faworyzujący recall.
Zdaniowy (ROUGE-L) vs poziom podsumowań (ROUGE-Lsum).
Opcjonalny stemming i usuwanie stop-słów; zmienia wartości i porównywalność wyników.
Sam LCS jednej pary jest sekwencyjny wewnętrznie, ale ewaluacja zbioru jest w pełni równoległa.
Lekki algorytm operujący na napisach; liczony na CPU bez potrzeby akceleratorów.