Samonadzorowany model wizyjny (vision foundation model) od Meta AI; flagowy ViT-7B trenowany bez etykiet, generuje gęste cechy obrazu bez fine-tuningu.
Parametry
6.7B (ViT-7B); warianty destylowane 21M–840M
parametrów
Data premiery
14 sierpnia 2025
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud
Przegląd
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 6.7B (ViT-7B); warianty destylowane 21M–840M
✓ Fine-tuning
📥 Wejście: obraz
Specyfikacja techniczna
Parametry
6.7B (ViT-7B); warianty destylowane 21M–840M
parametrów
Licencja
DINOv3 License
Funkcje:✓ Fine-tuning
Modalności
⬇ Wejście (Input)
image
⬆ Wyjście (Output)
structured_data
Wyniki benchmarków
2 benchmarki
ImageNet-1k
k-NN accuracy · frozen backbone k-NN
82.0%
📄 repository
ViT-L/16
ImageNet-1k
linear probe accuracy · frozen backbone linear eval
83.5%
📄 repository
ViT-L/16
Architektura techniczna
Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)
