BLEURT to model regresji zbudowany na bazie BERT. Trening przebiega dwuetapowo. (1) Wstępny trening (pre-training) na milionach syntetycznych par zdań tworzonych przez losowe perturbacje zdań z Wikipedii (m.in. maskowanie tokenów, permutacje, backtranslation); dla tych par nie zbiera się ocen ludzkich, lecz etykiety generuje zestaw istniejących sygnałów i modeli z literatury (m.in. BLEU, ROUGE, BERTScore, prawdopodobieństwo z backtranslation oraz sygnały wynikania tekstowego). Dzięki temu model uczy się ogólnej oceny podobieństwa i jest odporny na przesunięcie rozkładu. (2) Dostrajanie (fine-tuning) na niewielkim zbiorze ocen ludzkich (WMT Metrics Shared Task, WebNLG). Na wejściu model otrzymuje parę (kandydat, referencja), przepuszcza ją przez enkoder BERT/RemBERT, a głowica regresji nad reprezentacją zdania zwraca pojedynczą liczbę — przewidywaną ocenę jakości (w praktyce około 0 dla wyjścia losowego i 1 dla doskonałego).
Tradycyjne metryki, takie jak BLEU i ROUGE, mierzą powierzchniowe pokrycie n-gramów między wyjściem modelu a referencją, przez co słabo korelują z oceną ludzką i nie rozpoznają parafraz ani równoważności semantycznej. BLEURT rozwiązuje ten problem, ucząc się przewidywać oceny ludzkie i wychwytywać podobieństwo znaczeniowe, a nie tylko dosłowne dopasowanie słów, przy zachowaniu odporności na dane spoza rozkładu treningowego.
Wstępnie wytrenowany enkoder Transformera, który koduje parę (kandydat, referencja) w kontekstowe reprezentacje. Checkpointy jednojęzyczne opierają się na BERT, a wielojęzyczny BLEURT-20 na RemBERT.
Oficjalna
Warstwa liniowa nad reprezentacją zdania (token [CLS]), która odwzorowuje reprezentację na pojedynczą liczbę — przewidywaną ocenę jakości.
Etap pre-treningu na milionach syntetycznych par zdań (perturbacje Wikipedii) etykietowanych automatycznie przez istniejące metryki i modele (BLEU, ROUGE, BERTScore, backtranslation, wynikanie tekstowe). Zapewnia odporność i generalizację przy niewielkiej liczbie ocen ludzkich.
Oficjalna
Dostrajanie modelu na niewielkim zbiorze rzeczywistych ocen ludzkich (WMT Metrics Shared Task, WebNLG), które kalibruje predykcje do faktycznych sądów jakościowych.
Oficjalna
Surowe wartości BLEURT są przewidywaniami regresji i mogą wychodzić poza przedział 0–1; wartości ~0 i ~1 to jedynie orientacyjne punkty odniesienia (losowe vs doskonałe wyjście).
Różne checkpointy (BERT-base, BERT-large, BLEURT-20, BLEURT-20-D12) dają wartości w innych skalach; porównywanie wyników z różnych checkpointów jest błędne.
BLEURT wymaga referencji i jest dostrajany na ocenach ludzkich (głównie WMT), więc może przenosić obciążenia dziedzinowe/językowe i słabiej działać poza rozkładem danych treningowych.
Sellam, Das i Parikh przedstawiają wyuczoną metrykę opartą na BERT, wstępnie trenowaną na syntetycznych parach zdań i dostrajaną na ocenach ludzkich, o wyższej korelacji z oceną ludzką niż BLEU.
Praca 'Learning Compact Metrics for MT' (Pu i in., EMNLP 2021) rozwija wielojęzyczne metryki oparte na RemBERT i destylację; leży u podstaw rekomendowanego checkpointu BLEURT-20 i jego lżejszych wariantów (np. BLEURT-20-D12).
Złożoność czasowa: O(n² · d). Złożoność przestrzenna: O(n² + n · d).
Wybór wstępnie wytrenowanego enkodera: BERT (jednojęzyczny) lub RemBERT (wielojęzyczny, BLEURT-20). Decyduje o zasięgu językowym i jakości.
Liczba parametrów / liczba warstw. Większe checkpointy dają lepszą korelację kosztem szybkości; destylowane warianty (np. BLEURT-20-D12) obniżają koszt.
Limit tokenów dla sklejonej pary kandydat + referencja; dłuższe wejścia są przycinane, co może wpływać na ocenę bardzo długich tekstów.
BLEURT wykorzystuje gęsty enkoder Transformera (BERT/RemBERT) — wszystkie parametry są aktywne dla każdego wejścia; brak routingu warunkowego.
Enkoder przetwarza wszystkie tokeny pary równolegle w jednym przebiegu; ocenianie wielu par łatwo zbatchować.
Ocena to przebieg w przód przez enkoder Transformera; GPU z rdzeniami tensorowymi znacząco przyspiesza mnożenia macierzy i batchowanie par.
Referencyjna implementacja korzysta z TensorFlow i dobrze mapuje się na TPU dla treningu i masowej oceny.
BLEURT działa na CPU, ale wolniej; przydatne przy małej liczbie par lub braku akceleratora.