Ucieleśniony model fundamentowy (VLA) Generalist AI; uczy się nowych zadań fizycznych z jednego pokazu i generuje trajektorie ruchu 100 Hz.
Okno kontekstowe
~30 s wideo
tokenów
Data premiery
19 sierpnia 2026
Przegląd
Zastosowania
Dostęp i wdrożenie
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: ~30 s wideo
📥 Wejście: wideo, sensory robota, dane stanu robota, tekst
Robotyka
Dexterous manipulationRobot manipulationRobot controlEmbodied task planningMotion planningObject affordance understanding
Specyfikacja techniczna
Okno kontekstowe
~30 s wideo
tokenów
Modalności
⬇ Wejście (Input)
videorobot_sensorsrobot_state_datatext
⬆ Wyjście (Output)
robot_actionsmotion_trajectories
Możliwości i zastosowania
Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Robotyka
Dexterous manipulationRobot manipulationRobot controlEmbodied task planningMotion planningObject affordance understanding
Dziedziny zastosowań
Wyniki benchmarków
2 benchmarki
One-shot in-context task success
success rate · One-shot, promptowanie w kontekście
59% (±10%)%
📄 Oficjalny blog Generalist AI (GEN-1.5)
Few-shot task success (10 gradient steps)
success rate · Few-shot, 10 kroków gradientu na 1–5 min danych
83% (±9%)%
📄 Oficjalny blog Generalist AI (GEN-1.5)
Architektura techniczna
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)
