Każdy przykład zawiera kontekst (ctx, złożony z ctx_a i ctx_b) oraz listę czterech możliwych zakończeń; dokładnie jedno jest poprawne (pole label 0–3). Poprawne zakończenie pochodzi z oryginalnego źródła (ActivityNet lub WikiHow), a dystraktory są generowane maszynowo i selekcjonowane przez Adversarial Filtering: trenuje się dyskryminator do odróżniania tekstu ludzkiego od maszynowego, zachowuje wygenerowane przykłady oszukujące model i iteruje, aż zbiór jest trudny dla modeli, lecz łatwy dla ludzi (weryfikacja przez adnotatorów). Model oceniany jest trafnością wyboru poprawnego zakończenia; ewaluacja obejmuje kategorie in-domain oraz zero-shot (aktywności niewidziane w treningu).
Wcześniejsze benchmarki commonsense (np. SWAG) zostały szybko wysycone przez modele wstępnie trenowane jak BERT, co utrudniało pomiar rzeczywistego wnioskowania zdroworozsądkowego. HellaSwag tworzy trudne, adwersarialne przykłady, które pozostają łatwe dla ludzi, przywracając rozdźwięk człowiek–model jako miarę postępu.
Format zadania: kontekst (ctx_a + ctx_b) oraz cztery kandydujące zakończenia, z których jedno jest poprawne (label 0–3).
Paradygmat zbierania danych: zespół dyskryminatorów iteracyjnie selekcjonuje maszynowo generowane błędne odpowiedzi trudne dla modeli, lecz absurdalne dla ludzi.
Konteksty pochodzą z opisów filmów ActivityNet Captions oraz instrukcji WikiHow; obejmują kategorie in-domain i zero-shot.
Zellers i in. wprowadzają SWAG, benchmark commonsense NLI zbudowany metodą Adversarial Filtering.
Trudniejszy następca SWAG: dłuższe konteksty i przykłady z ActivityNet oraz WikiHow; ludzie >95%, modele SOTA <48%.
GPT-4 (marzec 2023) osiąga 95,3%, blisko poziomu ludzkiego 95,6%, praktycznie wysycając zadanie.
Każdy przykład ma 4 możliwe zakończenia, z których jedno jest poprawne.
Powszechnie ewaluowany w trybie zero-shot lub 10-shot w pakietach typu lm-evaluation-harness.