
Model estymacji głębi i geometrii wizualnej (ByteDance Seed). Z dowolnych widoków przewiduje głębię, pozy kamery i geometrię 3D, używając pojedynczego transformera z backbonem DINOv2.
Parametry
0,08–1,40 mld (SMALL → NESTED-GIANT-LARGE)
parametrów
Data premiery
14 listopada 2025
Dostęp:DownloadHostedWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Dostęp i wdrożenie
PobieranieHostowane
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 0,08–1,40 mld (SMALL → NESTED-GIANT-LARGE)
📥 Wejście: obraz, wideo, dane strukturalne
Specyfikacja techniczna
Parametry
0,08–1,40 mld (SMALL → NESTED-GIANT-LARGE)
parametrów
Licencja
Apache-2.0 (SMALL/BASE/METRIC/MONO); CC BY-NC 4.0 (LARGE/GIANT/NESTED)
Wymagania sprzętowe
Inferencja strumieniowa (streaming) działa na GPU z <12 GB VRAM.
Modalności
⬇ Wejście (Input)
imagevideostructured_data
⬆ Wyjście (Output)
3d_representationstructured_dataimage
Możliwości i zastosowania
Natywne możliwości modelu
Estymacja głębi
Przewidywanie mapy głębi (odległości od kamery) dla każdego piksela obrazu. Obejmuje głębię względną i metryczną.
Kategoria: vision
Estymacja pozy kamery
Wyznaczanie parametrów zewnętrznych i wewnętrznych kamery (ekstrynzyki i intrynzyki) na podstawie jednego lub wielu obrazów.
Kategoria: vision
Rekonstrukcja 3D
Odtwarzanie geometrii 3D sceny (chmury punktów, siatki, geometria wielowidokowa) na podstawie obrazów.
Kategoria: vision
Synteza nowych widoków
Generowanie widoków sceny z nowych punktów obserwacji, m.in. przez estymację 3D Gaussian Splatting.
Kategoria: vision
Dziedziny zastosowań
Wyniki benchmarków
1 benchmark
Visual Geometry Benchmark (VGB)
AUC / F1-score / Chamfer Distance · Any-view geometry, estymacja pozy kamery i renderowanie nowych widoków
SOTA: +44,3% dokładności pozy kamery i +25,1% dokładności geometrii vs VGGT
📄 paper
Wyniki z abstraktu i README. DA3 przewyższa wcześniejszy SOTA VGGT oraz Depth Anything 2 w monokularnej estymacji głębi.
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)