Robocikowo>ROBOCIKOWO
GEN-1.5

GEN-1.5

1.5 · Rodzina: GEN
Ucieleśniony model fundamentowy (VLA) Generalist AI; uczy się nowych zadań fizycznych z jednego pokazu i generuje trajektorie ruchu 100 Hz.
✓ AktywnyBazowy model robotycznyModel wzrok-język-akcjaModel multimodalny📁 GEN
Okno kontekstowe
~30 s wideo
tokenów
Data premiery
19 sierpnia 2026

Przegląd

GEN-1.5 to ucieleśniony model fundamentowy (embodied foundation model / Vision-Language-Action) opracowany przez Generalist AI, zaprezentowany 19 sierpnia 2026. Model przetwarza wejście wideo (okno kontekstu ok. 30 sekund) wraz z danymi z czujników, danymi proprioceptywnymi (stan robota) oraz językiem, a na wyjściu generuje trajektorie działań z częstotliwością 100 Hz.

Według producenta model wykazuje początki zdolności uczenia się fizycznych umiejętności w trybie one-shot: potrafi przyswoić nowe zadanie na podstawie pojedynczego pokazu trwającego od 3 do 12 sekund, a także adaptować się few-shot poprzez 1–10 kroków gradientu na 1–5 minutach danych. Deklarowane wyniki to średnio 59% (±10%) skuteczności przy promptowaniu one-shot w kontekście oraz 83% (±9%) po douczeniu few-shot (10 kroków gradientu), przy zmianie wag poniżej 0,15%.

Model był trenowany metodą skalowanego pretreningu na dużych zbiorach danych z fizycznych interakcji zbieranych w domach, magazynach i fabrykach; producent deklaruje ciągły pretrening trwający ponad 8 miesięcy. GEN-1.5 należy do rodziny modeli GEN (następca GEN-1).

Klasyfikacja
Bazowy model robotycznyModel wzrok-język-akcjaModel multimodalny
Rodzina: GEN
Dostęp i wdrożenie
Wagi: Zamknięte
Kluczowe parametry
📏 Kontekst: ~30 s wideo
📥 Wejście: wideo, sensory robota, dane stanu robota, tekst
Robotyka
Dexterous manipulationRobot manipulationRobot controlEmbodied task planningMotion planningObject affordance understanding

Specyfikacja techniczna

Okno kontekstowe
~30 s wideo
tokenów
Modalności
⬇ Wejście (Input)
videorobot_sensorsrobot_state_datatext
⬆ Wyjście (Output)
robot_actionsmotion_trajectories

Możliwości i zastosowania

Natywne możliwości modelu
Ugruntowanie wizualno-językowo-akcyjne
Zdolność modelu VLA do łączenia percepcji wizualnej i polecenia językowego z konkretnym działaniem fizycznym robota. Model rozumie scenę i intencję, a następnie generuje sekwencję akcji wykonawczych, zamykając pętlę od obserwacji do ruchu.
Kategoria: robotics
Warunkowanie akcjami
Sterowanie generacją modelu poprzez sygnały akcji (kamera, pose robota, komendy, mowa) zamiast wyłącznie promptem tekstowym.
Kategoria: multimodal
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video
Uczenie zero-shot
Zdolność modelu do wykonania nowego zadania bez treningu specyficznego dla danych ani strojenia hiperparametrów — predykcja powstaje w pojedynczym przebiegu na podstawie kontekstu.
Kategoria: other
Wnioskowanie w czasie rzeczywistym
Zdolność modelu do generowania odpowiedzi z bardzo niskim opóźnieniem (>1000 tokenów/s) na specjalistycznym sprzęcie inferencyjnym (np. Cerebras WSE), umożliwiająca interaktywną, wymianową współpracę z człowiekiem.
Kategoria: coding
Transfer międzyucieleśnieniowy
Zdolność jednego modelu do sterowania robotami o różnej budowie (humanoidy, ramiona dwuręczne, platformy mobilne) bez trenowania osobnego modelu na każdą platformę. Inteligencja jest oddzielona od ucieleśnienia, dzięki czemu ta sama polityka działa na sprzęcie o odmiennej kinematyce i dynamice.
Kategoria: robotics
Planowanie
Tworzenie i realizacja planów działania dla złożonych zadań.
Kategoria: planning
Robotyka
Dexterous manipulationRobot manipulationRobot controlEmbodied task planningMotion planningObject affordance understanding
Dziedziny zastosowań

Wyniki benchmarków

2 benchmarki
One-shot in-context task success
success rate · One-shot, promptowanie w kontekście
59% (±10%)%
📄 Oficjalny blog Generalist AI (GEN-1.5)
Few-shot task success (10 gradient steps)
success rate · Few-shot, 10 kroków gradientu na 1–5 min danych
83% (±9%)%
📄 Oficjalny blog Generalist AI (GEN-1.5)

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)