Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Dyna-2: milion godzin ludzkiego wideo daje robotom zręczność zero-shot

Pan Robocik15 sierpnia 2026 · 3 min czytania
Dyna-2: milion godzin ludzkiego wideo daje robotom zręczność zero-shot

Dyna Robotics zaprezentowała 10 sierpnia 2026 model Dyna-2 — world-action model wytrenowany na ponad milionie godzin nagrań wideo z perspektywy pierwszej osoby. Firma twierdzi, że to pierwsze udokumentowane prawo skalowania z człowieka na robota: więcej ludzkiego wideo w przewidywalny sposób poprawia zręczność robota na sprzęcie, którego model nigdy nie widział.

Najważniejsze w skrócie

  • Trening na 1 000 000 godzin wideo egocentrycznego (ok. 170 lat ciągłego ludzkiego doświadczenia)
  • 87% skuteczności w zero-shot wdrożeniach u klientów, wobec 46% dla wcześniejszego Dyna-1
  • 1,55x wyższa skuteczność niż Dyna-1 w kontrolowanych porównaniach
  • Punkt przegięcia skalowania między 10 000 a 100 000 godzin nagrań
  • Latencja generowania wideo spadła z 10 203 ms do 110 ms po dystylacji (90x szybciej)

Model, który przewiduje wideo i ruch naraz

Dyna-2 to world-action model (WAM) — pojedynczy model generatywny, który jednocześnie przewiduje przyszłe klatki wideo i akcje robota. Architektura to mixture-of-transformers zbudowany na bazie modelu video-diffusion z warstwami DiT. Transformer akcji jest celowo płytki i dołącza do strumienia wideo we wczesnych warstwach, by obniżyć latencję bez utraty jakości. Model wytrenowano wyłącznie na nagraniach z kamer na głowie — gotowanie, sprzątanie, składanie ubrań, montaż — z których wyekstrahowano trajektorie nadgarstków i ciągły sygnał chwytu.

Architektura Dyna-2 to jeden model generatywny złożony z trzech elementów:

video-diffusionszkielet generatywny
DiTwarstwy dyfuzyjnego transformera
action transformerpłytki, dołącza we wczesnych warstwach

Kluczowy wynik: model nie widział ani godziny danych robotycznych podczas pretreningu, a mimo to jego wyniki zero-shot: Działanie modelu na nowym zadaniu lub sprzęcie bez żadnego dodatkowego treningu ani przykładów. w 39 zadaniach na dwóch oburęcznych platformach YAM rosły monotonicznie wraz z ilością ludzkiego wideo. Dyna Robotics nazywa to pierwszym prawem skalowania transferu z człowieka na robota.

Wideo jako nowa oś skalowania

Firma zajmuje stanowisko wprost przeciwne dominującym modelom Vision-Language-Action (VLA), które opierają się na kosztownych danych z teleoperacja: Zbieranie danych przez zdalne sterowanie robotem przez człowieka — kosztowne i wolne. robotów. Według raportu samo skalowanie danych wideo — bez etykiet akcji — monotonicznie poprawiało generalizację na robota. Zdolność podążania za poleceniami wzrosła z 35% do 67% dzięki co-treningowi na wideo, osiągając 96% przy pełnej skali. Efekt jest najwyraźniejszy w trudnych zadaniach: w zadaniu przekręcania kluczyka w zamku model uzyskiwał 0% przez pierwsze 100 000 godzin, a potem 90% przy milionie godzin. Firma podsumowuje to zdaniem, że "wideo to nowa oś skalowania".

ZdolnośćPunkt wyjścia1 mln godzin wideo
Podążanie za poleceniami35%96%
Zamek — przekręcenie klucza0%90%

Dlaczego to ważne?

Jeśli wynik się utrzyma, zmienia ekonomię uczenia robotów. Dane z teleoperacji są drogie i wolne do zebrania, podczas gdy ludzkie wideo z perspektywy pierwszej osoby istnieje w niemal nieograniczonej ilości. Prawo skalowania oznacza, że postęp można kupić większym zbiorem wideo, a nie tylko nową architekturą. To przesuwa przewagę konkurencyjną ku firmom z dostępem do dużych archiwów nagrań i taniej mocy obliczeniowej. Podejście podważa też założenie, że zręczność wymaga danych z konkretnego robota.

Co dalej?

  • Pełny raport techniczny z krzywymi skalowania i wzorami jest dostępny pod dyna.co/dyna-2
  • Testy objęły dłonie WUJI-2 z 20 stopniami swobody i półhumanoidalny prototyp — co wskazuje kierunek na manipulację wielopalcową
  • Kluczowe zastrzeżenie: wyniki pochodzą z raportu firmy, a nie z niezależnie recenzowanej publikacji

Źródła

Udostępnij ten artykuł