Robocikowo>ROBOCIKOWO
Depth Anything 3

Depth Anything 3

3 · Rodzina: Depth Anything
Model estymacji głębi i geometrii wizualnej (ByteDance Seed). Z dowolnych widoków przewiduje głębię, pozy kamery i geometrię 3D, używając pojedynczego transformera z backbonem DINOv2.
✓ Aktywny✓ Publiczny dostęp⚖ Open weightsModel wzrokowyWyspecjalizowane AI📁 Depth Anything
Parametry
0,08–1,40 mld (SMALL → NESTED-GIANT-LARGE)
parametrów
Data premiery
14 listopada 2025
Dostęp:DownloadHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

Depth Anything 3 (DA3) to model widzenia komputerowego opracowany przez zespół ByteDance Seed, przedstawiony w pracy „Depth Anything 3: Recovering the Visual Space from Any Views” (arXiv:2511.10647, listopad 2025; ICLR 2026 Oral). DA3 odtwarza przestrzeń wizualną z dowolnej liczby obrazów lub wideo: przewiduje mapy głębi, pozy kamery (ekstrynzyki i intrynzyki) oraz geometrię 3D, a opcjonalnie także reprezentację 3D Gaussian Splatting do syntezy nowych widoków.

Kluczowe założenia projektowe to (1) pojedynczy, zwykły transformer — wystarcza standardowy enkoder DINOv2, bez specjalizacji architektonicznej — oraz (2) jeden cel predykcji typu „depth-ray”, który zastępuje złożone uczenie wielozadaniowe. Model korzysta z dekodera DualDPT i jest trenowany w paradygmacie nauczyciel–uczeń. Wydany jako open weights w wariantach od Small (0,08 mld parametrów) do Nested-Giant-Large (1,40 mld), z osobnymi wariantami do głębi metrycznej (DA3Metric-Large) i monokularnej (DA3Mono-Large).

Klasyfikacja
Model wzrokowyWyspecjalizowane AI
Dostęp i wdrożenie
PobieranieHostowane
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 0,08–1,40 mld (SMALL → NESTED-GIANT-LARGE)
📥 Wejście: obraz, wideo, dane strukturalne

Specyfikacja techniczna

Parametry
0,08–1,40 mld (SMALL → NESTED-GIANT-LARGE)
parametrów
Licencja
Apache-2.0 (SMALL/BASE/METRIC/MONO); CC BY-NC 4.0 (LARGE/GIANT/NESTED)
Wymagania sprzętowe
Inferencja strumieniowa (streaming) działa na GPU z <12 GB VRAM.
Modalności
⬇ Wejście (Input)
imagevideostructured_data
⬆ Wyjście (Output)
3d_representationstructured_dataimage

Możliwości i zastosowania

Natywne możliwości modelu
Estymacja głębi
Przewidywanie mapy głębi (odległości od kamery) dla każdego piksela obrazu. Obejmuje głębię względną i metryczną.
Kategoria: vision
Estymacja pozy kamery
Wyznaczanie parametrów zewnętrznych i wewnętrznych kamery (ekstrynzyki i intrynzyki) na podstawie jednego lub wielu obrazów.
Kategoria: vision
Rekonstrukcja 3D
Odtwarzanie geometrii 3D sceny (chmury punktów, siatki, geometria wielowidokowa) na podstawie obrazów.
Kategoria: vision
Synteza nowych widoków
Generowanie widoków sceny z nowych punktów obserwacji, m.in. przez estymację 3D Gaussian Splatting.
Kategoria: vision

Wyniki benchmarków

1 benchmark
Visual Geometry Benchmark (VGB)
AUC / F1-score / Chamfer Distance · Any-view geometry, estymacja pozy kamery i renderowanie nowych widoków
SOTA: +44,3% dokładności pozy kamery i +25,1% dokładności geometrii vs VGGT
📄 paper
Wyniki z abstraktu i README. DA3 przewyższa wcześniejszy SOTA VGGT oraz Depth Anything 2 w monokularnej estymacji głębi.

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)