Potok FAST działa na fragmentach (chunkach) sekwencji akcji w pięciu krokach: (1) Normalizacja — surowe chunki akcji są normalizowane; (2) DCT — dyskretna transformata kosinusowa zamienia znormalizowane akcje na współczynniki w dziedzinie częstotliwości; (3) Kwantyzacja — współczynniki częstotliwości są kwantyzowane, dając rzadkie macierze (większość energii sygnału skupia się w niskich częstotliwościach); (4) Spłaszczenie — rzadka macierz częstotliwości jest spłaszczana z priorytetem niskich częstotliwości; (5) BPE — algorytm Byte-Pair Encoding łączy często współwystępujące pary tokenów w pojedyncze tokeny, dając zwykle 30–60 tokenów na chunk. Powstałe tokeny są przewidywane autoregresyjnie przez transformer (backbone VLA), a przy dekodowaniu potok jest odwracany, by odtworzyć ciągłe akcje.
Standardowa tokenizacja akcji (dyskretny binning każdego wymiaru w każdym kroku czasowym) daje długie, silnie skorelowane sekwencje tokenów i całkowicie zawodzi przy zręcznych, wysokoczęstotliwościowych zadaniach — autoregresyjne modele nie były w stanie ich rozwiązać. FAST dostarcza zwięzłą, mało redundantną reprezentację tokenową, która umożliwia autoregresyjnym VLA naukę precyzyjnego sterowania.
Przekształca znormalizowany chunk akcji z dziedziny czasu do dziedziny częstotliwości, skupiając energię sygnału w niewielu niskoczęstotliwościowych współczynnikach.
Kwantyzuje współczynniki częstotliwości do rzadkiej reprezentacji, odrzucając mało istotne składowe wysokoczęstotliwościowe.
Spłaszcza rzadką macierz współczynników do sekwencji, umieszczając najpierw składowe niskoczęstotliwościowe.
Oficjalna
Kompresuje spłaszczoną sekwencję, łącząc często współwystępujące pary symboli w pojedyncze tokeny; daje zwykle 30–60 tokenów na chunk.
Oficjalna
Autoregresyjne dekodowanie 30–60 tokenów na chunk jest istotnie wolniejsze niż jednokrokowe dekodowanie flow matching stosowane w π0.
Tokenizer BPE trenowany na jednej dystrybucji akcji może słabo generalizować do innej częstotliwości sterowania lub przestrzeni akcji.
Physical Intelligence publikuje pracę arXiv:2501.09747, wprowadzając tokenizację FAST oraz π0-FAST — pierwszą autoregresyjną politykę ogólnego przeznaczenia dorównującą VLA opartym na dyfuzji przy ~5× krótszym treningu.
Udostępnienie FAST+ na Hugging Face — tokenizera wytrenowanego na 1 mln rzeczywistych trajektorii akcji, działającego jako czarna skrzynka dla różnych przestrzeni akcji i częstotliwości sterowania.
Liczba kroków czasowych akcji kodowanych w jednym chunku przed transformacją DCT.
Zgrubność kwantyzacji współczynników DCT — steruje kompromisem między kompresją a wiernością rekonstrukcji.
Rozmiar słownika Byte-Pair Encoding, wpływający na stopień kompresji i liczbę tokenów na chunk.
Kodowanie FAST (DCT+kwantyzacja+BPE) jest tanie i wykonywane offline/na CPU. Trening autoregresyjny na tokenach jest równoległy (teacher forcing), natomiast inferencja wymaga sekwencyjnego autoregresyjnego dekodowania 30–60 tokenów, co czyni ją wolniejszą niż dekodowanie flow matching w π0.
Sam potok FAST (DCT, kwantyzacja, BPE) jest lekki i niezależny od akceleratora — działa na CPU jako preprocessing.
Backbone VLA (transformer) trenowany i uruchamiany na tokenach FAST korzysta z rdzeni tensorowych GPU/TPU.