Robocikowo>ROBOCIKOWO
GAIA-2

GAIA-2

GAIA-2 · Rodzina: GAIA
Sterowalny, wielokamerowy model świata Wayve dla autonomicznej jazdy (dyfuzja latentna). Generuje realistyczne wideo do symulacji i treningu (UK/US/DE).
✓ Aktywny🔬 Research onlyModel świataModel generowania wideoModel multimodalny📁 GAIA
Data premiery
26 marca 2025
Wdrożenie:☁ Cloud

Przegląd

GAIA-2 to sterowalny, wielokamerowy generatywny model świata (world model) opracowany przez Wayve na potrzeby autonomicznej jazdy, zaprezentowany 26 marca 2025 r. Opisano go w pracy „GAIA-2: A Controllable Multi-View Generative World Model for Autonomous Driving” (arXiv:2503.20523). Model generuje realistyczne, spójne czasowo i przestrzennie materiały wideo z wielu kamer, przeznaczone do symulacji, testów scenariuszy oraz wzbogacania danych treningowych.

Architektura składa się z tokenizera wideo, który kompresuje sekwencje do ciągłej przestrzeni latentnej, oraz modelu świata opartego na dyfuzji latentnej, który przewiduje przyszłe stany sceny. W odróżnieniu od GAIA-1 (autoregresyjnego), GAIA-2 wykorzystuje dyfuzję latentną, natywnie obsługuje wiele kamer i eliminuje nieciągłości czasowe, poprawiając płynność ruchu i spójność między widokami.

Model przyjmuje bogate warunkowanie strukturalne: akcje pojazdu ego (prędkość, krzywizna skrętu), zachowania dynamicznych agentów (na podstawie prostopadłościanów 3D), atrybuty drogi (liczba pasów, ograniczenia prędkości, przejścia dla pieszych, sygnalizacja, skrzyżowania), czynniki środowiskowe (pogoda, pora dnia) oraz osadzenia CLIP i firmowych modeli. Obejmuje dane z Wielkiej Brytanii, USA i Niemiec.

GAIA-2 służy do generowania scenariuszy syntetycznych (w tym rzadkich i krytycznych dla bezpieczeństwa), testowania generalizacji poza rozkładem oraz uzupełniania danych rzeczywistych. Jest to model badawczy, własnościowy (wagi niedostępne publicznie).

Klasyfikacja
Model świataModel generowania wideoModel multimodalny
Rodzina: GAIA
Dostęp i wdrożenie
Chmura
Wagi: Zamknięte
Kluczowe parametry
📥 Wejście: wideo, tekst, dane strukturalne

Specyfikacja techniczna

Licencja
Proprietary (Wayve)
Modalności
⬇ Wejście (Input)
videotextstructured_data
⬆ Wyjście (Output)
video

Możliwości i zastosowania

Natywne możliwości modelu
Generowanie wideo
Zdolność modelu do generowania klipów wideo z opisu tekstowego, obrazu lub innego wideo, z kontrolą długości, rozdzielczości i charakterystyk wizualnych.
Kategoria: video
Generowanie danych syntetycznych
Generowanie syntetycznych zbiorów danych zachowujących statystyczne właściwości oryginału, używanych do uczenia modeli, testów i ochrony prywatności.
Kategoria: structured_generation
Symulacja świata
Zdolność modelu do generowania spójnych, interaktywnych symulacji środowisk fizycznych — utrzymywanie geometrii, oświetlenia i fizyki podczas eksploracji.
Kategoria: multimodal

Architektura techniczna

Forma modelu (Model Form)
Techniki trenowania (Training Techniques)