Dyna Robotics zaprezentowała 10 sierpnia 2026 model Dyna-2 — world-action model wytrenowany na ponad milionie godzin nagrań wideo z perspektywy pierwszej osoby. Firma twierdzi, że to pierwsze udokumentowane prawo skalowania z człowieka na robota: więcej ludzkiego wideo w przewidywalny sposób poprawia zręczność robota na sprzęcie, którego model nigdy nie widział.
Najważniejsze w skrócie
- Trening na 1 000 000 godzin wideo egocentrycznego (ok. 170 lat ciągłego ludzkiego doświadczenia)
- 87% skuteczności w zero-shot wdrożeniach u klientów, wobec 46% dla wcześniejszego Dyna-1
- 1,55x wyższa skuteczność niż Dyna-1 w kontrolowanych porównaniach
- Punkt przegięcia skalowania między 10 000 a 100 000 godzin nagrań
- Latencja generowania wideo spadła z 10 203 ms do 110 ms po dystylacji (90x szybciej)
Model, który przewiduje wideo i ruch naraz
Dyna-2 to world-action model (WAM) — pojedynczy model generatywny, który jednocześnie przewiduje przyszłe klatki wideo i akcje robota. Architektura to mixture-of-transformers zbudowany na bazie modelu video-diffusion z warstwami DiT. Transformer akcji jest celowo płytki i dołącza do strumienia wideo we wczesnych warstwach, by obniżyć latencję bez utraty jakości. Model wytrenowano wyłącznie na nagraniach z kamer na głowie — gotowanie, sprzątanie, składanie ubrań, montaż — z których wyekstrahowano trajektorie nadgarstków i ciągły sygnał chwytu.
Architektura Dyna-2 to jeden model generatywny złożony z trzech elementów:
Kluczowy wynik: model nie widział ani godziny danych robotycznych podczas pretreningu, a mimo to jego wyniki zero-shot?zero-shot: Działanie modelu na nowym zadaniu lub sprzęcie bez żadnego dodatkowego treningu ani przykładów. w 39 zadaniach na dwóch oburęcznych platformach YAM rosły monotonicznie wraz z ilością ludzkiego wideo. Dyna Robotics nazywa to pierwszym prawem skalowania transferu z człowieka na robota.
Wideo jako nowa oś skalowania
Firma zajmuje stanowisko wprost przeciwne dominującym modelom Vision-Language-Action (VLA), które opierają się na kosztownych danych z teleoperacji?teleoperacja: Zbieranie danych przez zdalne sterowanie robotem przez człowieka — kosztowne i wolne. robotów. Według raportu samo skalowanie danych wideo — bez etykiet akcji — monotonicznie poprawiało generalizację na robota. Zdolność podążania za poleceniami wzrosła z 35% do 67% dzięki co-treningowi na wideo, osiągając 96% przy pełnej skali. Efekt jest najwyraźniejszy w trudnych zadaniach: w zadaniu przekręcania kluczyka w zamku model uzyskiwał 0% przez pierwsze 100 000 godzin, a potem 90% przy milionie godzin. Firma podsumowuje to zdaniem, że "wideo to nowa oś skalowania".
| Zdolność | Punkt wyjścia | 1 mln godzin wideo |
|---|---|---|
| Podążanie za poleceniami | 35% | 96% |
| Zamek — przekręcenie klucza | 0% | 90% |
Dlaczego to ważne?
Jeśli wynik się utrzyma, zmienia ekonomię uczenia robotów. Dane z teleoperacji są drogie i wolne do zebrania, podczas gdy ludzkie wideo z perspektywy pierwszej osoby istnieje w niemal nieograniczonej ilości. Prawo skalowania oznacza, że postęp można kupić większym zbiorem wideo, a nie tylko nową architekturą. To przesuwa przewagę konkurencyjną ku firmom z dostępem do dużych archiwów nagrań i taniej mocy obliczeniowej. Podejście podważa też założenie, że zręczność wymaga danych z konkretnego robota.
Co dalej?
- Pełny raport techniczny z krzywymi skalowania i wzorami jest dostępny pod dyna.co/dyna-2
- Testy objęły dłonie WUJI-2 z 20 stopniami swobody i półhumanoidalny prototyp — co wskazuje kierunek na manipulację wielopalcową
- Kluczowe zastrzeżenie: wyniki pochodzą z raportu firmy, a nie z niezależnie recenzowanej publikacji
Źródła
- Humanoids Daily — Dyna-2 Proves Scaling Laws for Robotics: 1 Million Hours of Human Video Unlocks Zero-Shot Dexterity
- Dyna Robotics — Dyna-2 Technical Report





