W prompcie konstruuje się sekwencję: (1) opcjonalna instrukcja opisująca zadanie, (2) k demonstracji, z których każda pokazuje przykładowe wejście wraz z poprawnym wyjściem w spójnym formacie, (3) właściwe wejście zakończone sygnałem, po którym model ma kontynuować generację. Cała sekwencja trafia do modelu jako jeden kontekst; mechanizm uwagi (self-attention) pozwala modelowi odnieść nowe wejście do wzorców widocznych w demonstracjach i wygenerować odpowiedź o analogicznej strukturze. Nie zachodzi żadna aktualizacja wag — „uczenie" odbywa się wyłącznie w przód, w obrębie aktywacji kontekstu. Jakość wyniku zależy od liczby przykładów (k), ich reprezentatywności, kolejności oraz spójności formatu i etykiet (verbalizerów).
Klasyczne dostosowanie modelu do nowego zadania wymaga zebrania oznaczonego zbioru danych i przeprowadzenia dostrajania (fine-tuningu), co jest kosztowne i wolne. Few-shot prompting rozwiązuje ten problem, pozwalając zaadaptować gotowy, wstępnie wytrenowany model do nowego zadania w czasie inferencji, wyłącznie na podstawie kilku przykładów w prompcie, bez treningu i bez tworzenia osobnej kopii wag.
Opcjonalny opis w języku naturalnym, który określa, co model ma zrobić. Może być pominięty, gdy same demonstracje wystarczająco definiują zadanie.
Oficjalna
Zestaw k par wejście–wyjście pokazujących poprawne rozwiązanie zadania w spójnym formacie. Kluczowy element, na podstawie którego model wnioskuje wzorzec.
Nowe wejście, dla którego model ma wygenerować odpowiedź, sformatowane tak samo jak wejścia w demonstracjach.
Znacznik lub etykieta (verbalizer) sygnalizujący, gdzie i w jakiej formie model ma kontynuować generację odpowiedzi.
Oficjalna
Zmiana kolejności demonstracji może istotnie zmienić predykcję (bias większościowy i recency).
Losowe przykłady dają gorsze wyniki niż przykłady dobrze dopasowane do zapytania.
Duża liczba przykładów wyczerpuje okno kontekstowe oraz zwiększa koszt i opóźnienie inferencji.
Niespójny format separatorów lub etykiet obniża zdolność modelu do wnioskowania wzorca.
Praca „Language Models are Few-Shot Learners" wprowadza GPT-3 i rozróżnia ustawienia zero-, one- i few-shot, pokazując, że skala modelu umożliwia uczenie w kontekście.
„What Makes Good In-Context Examples for GPT-3?" pokazuje, że wyszukiwanie przykładów podobnych do zapytania (retrieval) istotnie poprawia wyniki względem losowego doboru.
„Calibrate Before Use" dokumentuje bias większościowy, recency i wrażliwość na kolejność przykładów oraz proponuje kalibrację wyjścia.
„Rethinking the Role of Demonstrations" pokazuje, że format i przestrzeń etykiet demonstracji mają większe znaczenie niż poprawność samych etykiet.
Chain-of-Thought prompting rozszerza few-shot o demonstracje z krokami rozumowania, znacząco poprawiając zadania wymagające wieloetapowego wnioskowania.
Złożoność czasowa: O(n² · d). Złożoność przestrzenna: O(n · d).
Liczba przykładów jest ograniczona długością okna kontekstowego modelu; dłuższy prompt zwiększa koszt i opóźnienie inferencji oraz zużycie pamięci KV-cache.
Ile demonstracji umieszczono w prompcie. Zwykle 1–32; ograniczone oknem kontekstowym. Więcej przykładów zwykle poprawia wynik do pewnego nasycenia.
Sposób wyboru demonstracji: losowo, ręcznie lub przez wyszukiwanie najbardziej podobnych do zapytania (retrieval). Dobór silnie wpływa na jakość.
Kolejność demonstracji w prompcie. Modele bywają wrażliwe na kolejność (efekt recency i bias większościowy), co wpływa na stabilność wyników.
Format separatorów, etykiet i verbalizerów łączących wejścia i wyjścia. Spójny format jest kluczowy dla poprawnego wnioskowania wzorca.
Technika inferencyjna korzystająca z pełnego, gęstego przebiegu bazowego modelu językowego; sama nie wprowadza routingu.
Przetwarzanie promptu (prefill) jest równoległe względem tokenów; generacja odpowiedzi pozostaje sekwencyjna (autoregresyjna).
To technika promptowania na poziomie inferencji — działa na dowolnym sprzęcie zdolnym uruchomić bazowy model językowy.
Dłuższe prompty few-shot korzystają z akceleratorów o dużej przepustowości i pamięci (GPU z Tensor Cores) przy inferencji LLM.