Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Skild AI pokazuje S1: robot uczy się zadania z jednego wideo

Pan Robocik3 września 2026 · 3 min czytania
Skild AI pokazuje S1: robot uczy się zadania z jednego wideo

Skild AI udostępniło S1 — flagowy foundation model dla robotów, który uczy się nowego zadania z jednego nagrania wideo, bez dotrenowywania wag. Model opisano na blogu firmy w sierpniu 2026, a 31 sierpnia szczegóły przedstawił w rozmowie z The Robot Report współzałożyciel i CEO Deepak Pathak. To próba przeniesienia in-context learning z modeli językowych wprost do sterowania robotem.

Najważniejsze w skrócie

  • S1 wykonuje nieznane wcześniej zadania trwające do 10 minut po jednym pokazie wideo
  • 66 proc. skuteczności na nieznanych zadaniach wobec 9 proc. dla polityk sterowanych opisem językowym
  • Jeden przykład w kontekście odpowiada mniej więcej 380 epizodom post-treningu
  • Pretrening łączy teleoperację, dane z rękawic UMI, wideo egocentryczne i symulację
  • Skild AI zebrało od 2023 roku blisko 1,7 mld USD (ok. 6,8 mld zł)

Jedno wideo zamiast dotrenowywania

Nowe zadanie zwykle oznacza nową rundę post-trening: Dodatkowy etap uczenia modelu po pretreningu, dostrajający go do konkretnego zadania.. S1 omija ten krok. Nagranie człowieka wykonującego czynność trafia do promptu, a model odtwarza intencję pokazu na robocie.

Skild podaje 96 proc. skuteczności na zadaniach widzianych w treningu przy 100 tys. godzin pretreningu i 66 proc. na zadaniach nieznanych — wobec 9 proc. dla porównywalnych polityk sterowanych opisem tekstowym.

380tylu epizodom post-treningu odpowiada jeden pokaz wideo podany w kontekścieSkild AI, model card S1
Wystarczy dodać do promptu wideo z człowiekiem, który coś robi, a robot to powtórzy. Zadania, które pokazujemy, są złożone i długie — nie trzy- czy czterosekundowe drobiazgi.

Deepak Pathak, współzałożyciel i CEO Skild AI.

Cztery źródła danych zamiast jednego

Pretrening S1 miesza cztery strumienie danych zamiast opierać się na jednym. Każde źródło ma inny profil: teleoperacja daje najwyższą jakość, ale skaluje się najgorzej, wideo egocentryczne odwrotnie, a rękawice UMI leżą pośrodku. Na kontrolę jakości firma wydaje około trzech dolarów na każdego dolara przeznaczonego na zbieranie danych.

Cztery strumienie, z których zbudowano pretrening S1:

teleoperacjaczłowiek steruje robotem bezpośrednio — najwyższa jakość, najgorsza skalowalność
rękawice UMIczłowiek wykonuje zadanie w rękawicach zbierających ruch dłoni
wideo egocentrycznenagrania z perspektywy pierwszej osoby — najlepiej się skaluje
symulacjaśrodowisko wirtualne, w którym dane powstają bez fizycznego robota

Omni-bodied, ale humanoidy dopiero przed firmą

Model działa na czworonogach, ramionach stacjonarnych i humanoidach — Skild nazywa to podejściem omni-bodied. Pokazane zadania to m.in. przesadzanie rośliny, parzenie kawy przelewowej i smażenie naleśników. Podobny mechanizm uczenia z jednego pokazu opisywaliśmy przy okazji modelu GEN-1.5.

Dlaczego to ważne?

Robotyka od lat tkwi w modelu, w którym każde nowe zadanie kosztuje osobną rundę zbierania danych i treningu. Jeśli liczby Skild utrzymają się poza kontrolowanymi demonstracjami, koszt wdrożenia przestanie rosnąć liniowo z liczbą zadań — a to zmienia ekonomię branży mocniej niż kolejny punkt procentowy na benchmarku. Sam Pathak studzi oczekiwania: to jeszcze nie moment ChatGPT dla robotyki, tylko jego pierwszy sygnał.

Co dalej?

  • Pokaz S1 w zastosowaniach produkcyjnych zapowiedziany na najbliższe tygodnie (Pathak, 31 sierpnia 2026)
  • Wdrożenia magazynowe oprą się na dywizji robotycznej Zebra Technologies (dawniej Fetch Robotics), przejętej w kwietniu 2026
  • Skalowanie modelu pod humanoidy firma wskazuje jako kolejny kierunek prac

Źródła

Udostępnij ten artykuł