Skild AI udostępniło S1 — flagowy foundation model dla robotów, który uczy się nowego zadania z jednego nagrania wideo, bez dotrenowywania wag. Model opisano na blogu firmy w sierpniu 2026, a 31 sierpnia szczegóły przedstawił w rozmowie z The Robot Report współzałożyciel i CEO Deepak Pathak. To próba przeniesienia in-context learning z modeli językowych wprost do sterowania robotem.
Najważniejsze w skrócie
- S1 wykonuje nieznane wcześniej zadania trwające do 10 minut po jednym pokazie wideo
- 66 proc. skuteczności na nieznanych zadaniach wobec 9 proc. dla polityk sterowanych opisem językowym
- Jeden przykład w kontekście odpowiada mniej więcej 380 epizodom post-treningu
- Pretrening łączy teleoperację, dane z rękawic UMI, wideo egocentryczne i symulację
- Skild AI zebrało od 2023 roku blisko 1,7 mld USD (ok. 6,8 mld zł)
Jedno wideo zamiast dotrenowywania
Nowe zadanie zwykle oznacza nową rundę post-treningu?post-trening: Dodatkowy etap uczenia modelu po pretreningu, dostrajający go do konkretnego zadania.. S1 omija ten krok. Nagranie człowieka wykonującego czynność trafia do promptu, a model odtwarza intencję pokazu na robocie.
Skild podaje 96 proc. skuteczności na zadaniach widzianych w treningu przy 100 tys. godzin pretreningu i 66 proc. na zadaniach nieznanych — wobec 9 proc. dla porównywalnych polityk sterowanych opisem tekstowym.
Wystarczy dodać do promptu wideo z człowiekiem, który coś robi, a robot to powtórzy. Zadania, które pokazujemy, są złożone i długie — nie trzy- czy czterosekundowe drobiazgi.
Deepak Pathak, współzałożyciel i CEO Skild AI.
Cztery źródła danych zamiast jednego
Pretrening S1 miesza cztery strumienie danych zamiast opierać się na jednym. Każde źródło ma inny profil: teleoperacja daje najwyższą jakość, ale skaluje się najgorzej, wideo egocentryczne odwrotnie, a rękawice UMI leżą pośrodku. Na kontrolę jakości firma wydaje około trzech dolarów na każdego dolara przeznaczonego na zbieranie danych.
Cztery strumienie, z których zbudowano pretrening S1:
Omni-bodied, ale humanoidy dopiero przed firmą
Model działa na czworonogach, ramionach stacjonarnych i humanoidach — Skild nazywa to podejściem omni-bodied. Pokazane zadania to m.in. przesadzanie rośliny, parzenie kawy przelewowej i smażenie naleśników. Podobny mechanizm uczenia z jednego pokazu opisywaliśmy przy okazji modelu GEN-1.5.
Dlaczego to ważne?
Robotyka od lat tkwi w modelu, w którym każde nowe zadanie kosztuje osobną rundę zbierania danych i treningu. Jeśli liczby Skild utrzymają się poza kontrolowanymi demonstracjami, koszt wdrożenia przestanie rosnąć liniowo z liczbą zadań — a to zmienia ekonomię branży mocniej niż kolejny punkt procentowy na benchmarku. Sam Pathak studzi oczekiwania: to jeszcze nie moment ChatGPT dla robotyki, tylko jego pierwszy sygnał.
Co dalej?
- Pokaz S1 w zastosowaniach produkcyjnych zapowiedziany na najbliższe tygodnie (Pathak, 31 sierpnia 2026)
- Wdrożenia magazynowe oprą się na dywizji robotycznej Zebra Technologies (dawniej Fetch Robotics), przejętej w kwietniu 2026
- Skalowanie modelu pod humanoidy firma wskazuje jako kolejny kierunek prac
Źródła
- Skild AI — Introducing S1: In-Context Learning for Robotics
- The Robot Report — Skild AI unveils S1 flagship robot foundation model
- Skild AI — Skild AI Acquires Zebra Technologies' Robotics Division





