Robocikowo>ROBOCIKOWO
Veo 3

Veo 3

3 · Rodzina: Veo
Model generowania wideo Google DeepMind (2025) z natywnym dzwiekiem (dialogi, efekty, tlo). Klipy 8 s, rozdzielczosc do 4K, realistyczna fizyka; warianty Standard i Fast; znak wodny SynthID.
✓ Aktywny✓ Publiczny dostępModel generowania wideo📁 Veo
Data premiery
20 maja 2025
Dostęp:APIHostedWdrożenie:☁ Cloud

Przegląd

Veo 3 to model generowania wideo (text-to-video oraz image-to-video) opracowany przez Google DeepMind, zaprezentowany w 2025 roku (Google I/O). Jego najwazniejsza nowoscia wzgledem Veo 2 jest natywne generowanie dzwieku: model tworzy dialogi, efekty dzwiekowe i dzwieki otoczenia zsynchronizowane z obrazem w ramach jednego procesu generacji.

Model generuje 8-sekundowe klipy w rozdzielczosci do 1080p oraz 4K (720p dostepne w API), cechuje sie realistyczna fizyka swiata i wysoka zgodnoscia z promptem. Wystepuje w wariantach Veo 3 (Standard) oraz Veo 3 Fast (szybszy i tanszy). Kazdy wygenerowany material jest oznaczany niewidocznym znakiem wodnym SynthID.

Veo 3 dostepny jest przez Gemini API (modele veo-3.0-*), Vertex AI, aplikacje Google (Gemini) oraz narzedzie filmowe Flow. Cennik Gemini API (za sekunde wideo z dzwiekiem): Veo 3 Standard 0,40 USD/s; Veo 3 Fast 0,10 USD/s (720p), 0,12 USD/s (1080p) oraz 0,30 USD/s (4K).

Klasyfikacja
Model generowania wideo
Rodzina: Veo
Dostęp i wdrożenie
APIHostowane
Chmura
Wagi: Zamknięte
Kluczowe parametry
📥 Wejście: tekst, obraz

Specyfikacja techniczna

Licencja
Wlasnosciowa (zamkniete wagi)
Wymagania sprzętowe
Dostep wylacznie przez chmure (Gemini API / Vertex AI); brak wag do pobrania. Klipy 8 s, do 4K.
Modalności
⬇ Wejście (Input)
textimage
⬆ Wyjście (Output)
videoaudio

Możliwości i zastosowania

Natywne możliwości modelu
Generowanie wideo
Zdolność modelu do generowania klipów wideo z opisu tekstowego, obrazu lub innego wideo, z kontrolą długości, rozdzielczości i charakterystyk wizualnych.
Kategoria: video
Generowanie wideo z tekstu (text-to-video)
Generowanie sekwencji wideo na podstawie opisu tekstowego (i opcjonalnie obrazu), z zachowaniem spojnej dynamiki sceny.
Kategoria: video
Animacja obrazu (image-to-video)
Zdolność modelu do animowania statycznego obrazu wejściowego — przedłużania go w czasie do spójnego klipu wideo zgodnie z opisem ruchu lub akcji.
Kategoria: video
Generowanie wideo wieloujęciowego
Zdolność modelu do generowania spójnych narracyjnie sekwencji złożonych z wielu ujęć, z zachowaniem tożsamości bohaterów, stylu i ciągłości między przejściami kadrów.
Kategoria: video
Natywne generowanie audio do wideo
Zdolnosc modelu wideo do generowania sciezki dzwiekowej natywnie razem z obrazem: dialogow, efektow dzwiekowych i dzwiekow otoczenia zsynchronizowanych z generowanym wideo.
Kategoria: multimodal

Cennik

Architektura techniczna

Rdzeń architektury (Core Architecture)

Wdrożenie i bezpieczeństwo

🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise

Wszystkie wygenerowane wideo zawieraja znak wodny SynthID. Dostepny w Vertex AI z kontrolami bezpieczenstwa i zgodnosci Google Cloud (IAM, VPC-SC, rezydencja danych).

SynthID to niewidoczny znak wodny Google DeepMind do oznaczania tresci generowanych przez AI.
Aktualizacja: 30 lip 2026↗ Dokumentacja security