Generalist AI zaprezentowało 19 sierpnia 2026 GEN-1.5 — swój najnowszy robotyczny model foundation, który potrafi nauczyć się nowego zadania z jednego pokazu trwającego od 3 do 12 sekund, bez żadnego dotrenowania. Firma opisuje to jako zdolność wyłaniającą się wprost z pretrenowania, a nie efekt osobnego modułu.
Najważniejsze w skrócie
- GEN-1.5 to multimodalny model przetwarzający wideo, dane z czujników, język i propriocepcję?Propriocepcja: Zmysł położenia własnego ciała — u robota dane o kątach stawów i napięciach, dzięki którym „czuje” układ swoich członów. na trajektorie ruchu robota z częstotliwością 100 Hz.
- Uczenie one-shot przez „physical prompting”: średnio 59% skuteczności na różnych zadaniach po jednym pokazie.
- Adaptacja few-shot: 83% skuteczności po 10 krokach gradientu na 5 minutach danych.
- Dodatkowo: transfer sim-to-real zero-shot, uczenie z ludzkiego wideo, praca oburęczna i improwizacja użycia narzędzi.
Uczenie w kontekście, tym razem fizyczne
W modelach językowych uczenie w kontekście — gdy model łapie nowe zadanie z kilku przykładów w promptcie, bez zmiany wag — jest znane od lat. GEN-1.5 przenosi ten mechanizm na fizyczne sterowanie robotem w zamkniętej pętli. Zamiast tekstowego przykładu model dostaje krótki pokaz ruchu (firma nazywa to physical prompting?Physical prompting: Nauczenie robota zadania przez krótki pokaz ruchu zamiast przykładu tekstowego — fizyczny odpowiednik promptu w modelu językowym.) i od razu próbuje odtworzyć zadanie. Kluczowe jest to, że zdolność ta wyłania się z pretrenowania na dużej skali fizycznego doświadczenia, bez architektury zaprojektowanej pod uczenie w kontekście.
To pierwszy znany nam model, który wykazał ogólną zdolność uczenia się szerokiej gamy zręcznych zadań fizycznych w zamkniętej pętli z jednego lub kilku pokazów.
Generalist AI, wpis na blogu firmy z 19 sierpnia 2026.
Dwie ścieżki adaptacji
GEN-1.5 daje dwa tryby uczenia nowego zadania. Szybki to one-shot z jednego pokazu, ze średnią skutecznością 59% — imponujące jak na brak jakiegokolwiek treningu, ale wciąż zawodne. Dokładniejszy to few-shot: po zaledwie 10 krokach gradientu na pięciu minutach danych skuteczność rośnie do 83%. Ta różnica pokazuje realny kompromis — natychmiastowość kontra niezawodność — a nie gotowy produkt do fabryki.
| Tryb uczenia | Wymagane dane | Skuteczność |
|---|---|---|
| One-shot (physical prompting) | 1 pokaz (3–12 s) | ~59% średnio |
| Few-shot | 5 min danych + 10 kroków gradientu | 83% |
Dlaczego to ważne?
Wąskim gardłem robotyki nie jest dziś sprzęt, lecz koszt uczenia każdego nowego zadania. Jeśli robot potrafi podłapać czynność z kilkusekundowego pokazu, znika najdroższy etap: zbieranie danych i dostrajanie pod konkretne stanowisko. To ten sam skok, który uczenie w kontekście przyniosło modelom językowym, tyle że w świecie fizycznym — i dlatego wynik przyciąga uwagę mimo skromnej jeszcze skuteczności one-shot.
Co dalej?
- GEN-1.5 zaprezentowano jako wynik badawczy na blogu Generalist AI (19 sierpnia 2026), bez ogłoszonej daty wdrożenia komercyjnego.
- Realnym testem będzie utrzymanie skuteczności one-shot poza demonstracjami — dziś średnia 59% to za mało do samodzielnej pracy bez nadzoru.
Źródła
- Generalist AI — GEN-1.5 robot foundation model
- IEEE Spectrum — Video Friday: Do We Need Superhuman Humanoid Robots?





