Robocikowo>ROBOCIKOWO
Ocena jakości

BLEURT

2020AktywnyOpublikowano: 25 sierpnia 2026Aktualizacja: 25 sierpnia 2026Opublikowany
Wyuczona, oparta na BERT metryka oceny jakości generowanego tekstu, dostrojona do przewidywania ocen ludzkich; koreluje z nimi lepiej niż BLEU.
Kluczowa innowacja
Zastąpiła metryki oparte na dopasowaniu n-gramów (BLEU, ROUGE) wyuczonym modelem opartym na BERT, który przewiduje oceny ludzkie i znacznie lepiej z nimi koreluje, a odporność zawdzięcza wstępnemu treningowi na milionach syntetycznych par zdań.
Kategoria
Ocena jakości
Poziom abstrakcji
Building block
Poziom operacji
Ewaluacja (runtime)Inferencja
Zastosowania
Ocena jakości tłumaczenia maszynowegoEwaluacja generowania tekstu (data-to-text, streszczanie, dialog)Ewaluacja tłumaczenia języka migowego (FLEURS-ASL, Sign-Language-to-Text)Benchmarking i porównywanie modeli NLGAutomatyczna ocena parafraz i równoważności semantycznej

Jak działa

BLEURT to model regresji zbudowany na bazie BERT. Trening przebiega dwuetapowo. (1) Wstępny trening (pre-training) na milionach syntetycznych par zdań tworzonych przez losowe perturbacje zdań z Wikipedii (m.in. maskowanie tokenów, permutacje, backtranslation); dla tych par nie zbiera się ocen ludzkich, lecz etykiety generuje zestaw istniejących sygnałów i modeli z literatury (m.in. BLEU, ROUGE, BERTScore, prawdopodobieństwo z backtranslation oraz sygnały wynikania tekstowego). Dzięki temu model uczy się ogólnej oceny podobieństwa i jest odporny na przesunięcie rozkładu. (2) Dostrajanie (fine-tuning) na niewielkim zbiorze ocen ludzkich (WMT Metrics Shared Task, WebNLG). Na wejściu model otrzymuje parę (kandydat, referencja), przepuszcza ją przez enkoder BERT/RemBERT, a głowica regresji nad reprezentacją zdania zwraca pojedynczą liczbę — przewidywaną ocenę jakości (w praktyce około 0 dla wyjścia losowego i 1 dla doskonałego).

Rozwiązany problem

Tradycyjne metryki, takie jak BLEU i ROUGE, mierzą powierzchniowe pokrycie n-gramów między wyjściem modelu a referencją, przez co słabo korelują z oceną ludzką i nie rozpoznają parafraz ani równoważności semantycznej. BLEURT rozwiązuje ten problem, ucząc się przewidywać oceny ludzkie i wychwytywać podobieństwo znaczeniowe, a nie tylko dosłowne dopasowanie słów, przy zachowaniu odporności na dane spoza rozkładu treningowego.

Komponenty

Enkoder BERT / RemBERTKodowanie semantyczne pary zdań

Wstępnie wytrenowany enkoder Transformera, który koduje parę (kandydat, referencja) w kontekstowe reprezentacje. Checkpointy jednojęzyczne opierają się na BERT, a wielojęzyczny BLEURT-20 na RemBERT.

Oficjalna

Głowica regresjiPredykcja oceny jakości

Warstwa liniowa nad reprezentacją zdania (token [CLS]), która odwzorowuje reprezentację na pojedynczą liczbę — przewidywaną ocenę jakości.

Wstępny trening na syntetycznych sygnałachOdporność i generalizacja

Etap pre-treningu na milionach syntetycznych par zdań (perturbacje Wikipedii) etykietowanych automatycznie przez istniejące metryki i modele (BLEU, ROUGE, BERTScore, backtranslation, wynikanie tekstowe). Zapewnia odporność i generalizację przy niewielkiej liczbie ocen ludzkich.

Oficjalna

Dostrajanie na ocenach ludzkichKalibracja do ocen ludzkich

Dostrajanie modelu na niewielkim zbiorze rzeczywistych ocen ludzkich (WMT Metrics Shared Task, WebNLG), które kalibruje predykcje do faktycznych sądów jakościowych.

Oficjalna

Implementacja

Pułapki implementacyjne
Wyniki nie są ściśle w zakresie 0–1Średnia

Surowe wartości BLEURT są przewidywaniami regresji i mogą wychodzić poza przedział 0–1; wartości ~0 i ~1 to jedynie orientacyjne punkty odniesienia (losowe vs doskonałe wyjście).

Rozwiązanie:Traktuj wynik jako względny; nie zakładaj twardego zakresu i nie interpretuj wartości bezwzględnych jako procentów.
Brak porównywalności między checkpointamiWysoka

Różne checkpointy (BERT-base, BERT-large, BLEURT-20, BLEURT-20-D12) dają wartości w innych skalach; porównywanie wyników z różnych checkpointów jest błędne.

Rozwiązanie:Zawsze raportuj użyty checkpoint i porównuj wyniki wyłącznie w obrębie tego samego checkpointu.
Zależność od referencji i danych dostrajaniaŚrednia

BLEURT wymaga referencji i jest dostrajany na ocenach ludzkich (głównie WMT), więc może przenosić obciążenia dziedzinowe/językowe i słabiej działać poza rozkładem danych treningowych.

Rozwiązanie:Waliduj metrykę na własnej dziedzinie/języku; przy potrzebie oceny bez referencji rozważ metryki reference-free (np. COMET-QE).

Ewolucja

Oryginalny paper · 2020 · ACL 2020 · Thibault Sellam
BLEURT: Learning Robust Metrics for Text Generation
Thibault Sellam, Dipanjan Das, Ankur P. Parikh
2020
Publikacja BLEURT na ACL 2020
Punkt przełomowy

Sellam, Das i Parikh przedstawiają wyuczoną metrykę opartą na BERT, wstępnie trenowaną na syntetycznych parach zdań i dostrajaną na ocenach ludzkich, o wyższej korelacji z oceną ludzką niż BLEU.

2021
BLEURT-20: wielojęzyczne i destylowane metryki (RemBERT)

Praca 'Learning Compact Metrics for MT' (Pu i in., EMNLP 2021) rozwija wielojęzyczne metryki oparte na RemBERT i destylację; leży u podstaw rekomendowanego checkpointu BLEURT-20 i jego lżejszych wariantów (np. BLEURT-20-D12).

Hiperparametry (konfigurowalne osie)

Bazowy checkpointKrytyczna

Wybór wstępnie wytrenowanego enkodera: BERT (jednojęzyczny) lub RemBERT (wielojęzyczny, BLEURT-20). Decyduje o zasięgu językowym i jakości.

BERT (BLEURT base/large)
RemBERT (BLEURT-20)
Rozmiar modeluWysoka

Liczba parametrów / liczba warstw. Większe checkpointy dają lepszą korelację kosztem szybkości; destylowane warianty (np. BLEURT-20-D12) obniżają koszt.

BLEURT-20 (pełny)
BLEURT-20-D12 (destylowany, 12 warstw)
Maksymalna długość sekwencjiŚrednia

Limit tokenów dla sklejonej pary kandydat + referencja; dłuższe wejścia są przycinane, co może wpływać na ocenę bardzo długich tekstów.

Złożoność obliczeniowa

Złożoność czasowa: O(n² · d). Złożoność przestrzenna: O(n² + n · d).

Paradygmat wykonania

Tryb główny
Gęsty

BLEURT wykorzystuje gęsty enkoder Transformera (BERT/RemBERT) — wszystkie parametry są aktywne dla każdego wejścia; brak routingu warunkowego.

Wzorzec aktywacji
Wszystkie ścieżki aktywne

Równoległość

Poziom równoległości
W pełni równoległy

Enkoder przetwarza wszystkie tokeny pary równolegle w jednym przebiegu; ocenianie wielu par łatwo zbatchować.

Zakres
InferencjaTreningPomiędzy tokenami

Wymagania sprzętowe

Podstawowe

Ocena to przebieg w przód przez enkoder Transformera; GPU z rdzeniami tensorowymi znacząco przyspiesza mnożenia macierzy i batchowanie par.

Dobry fit

Referencyjna implementacja korzysta z TensorFlow i dobrze mapuje się na TPU dla treningu i masowej oceny.

Możliwe

BLEURT działa na CPU, ale wolniej; przydatne przy małej liczbie par lub braku akceleratora.