Robocikowo>ROBOCIKOWO
DINOv3

DINOv3

v3 · Rodzina: DINO
Samonadzorowany model wizyjny (vision foundation model) od Meta AI; flagowy ViT-7B trenowany bez etykiet, generuje gęste cechy obrazu bez fine-tuningu.
✓ Aktywny✓ Publiczny dostęp⚖ Open weightsModel wzrokowy📁 DINO
Parametry
6.7B (ViT-7B); warianty destylowane 21M–840M
parametrów
Data premiery
14 sierpnia 2025
Dostęp:DownloadWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

DINOv3 to rodzina samonadzorowanych modeli wizyjnych (vision foundation models) opracowana przez Meta AI, zaprezentowana 14 sierpnia 2025. Modele uczone są bez etykiet na 1,7 mld obrazów (zbiór LVD-1689M), a flagowy wariant ViT-7B ma około 6,7 mld parametrów.

Meta udostępniła też warianty destylowane (ViT-S, ViT-S+, ViT-B, ViT-L, ViT-H+ oraz backbony ConvNeXt T/S/B/L) i wariant satelitarny trenowany na zbiorze SAT-493M. Kluczową techniką jest Gram anchoring, która przeciwdziała degradacji gęstych map cech podczas długiego treningu.

Modele osiągają wyniki na poziomie stanu wiedzy w detekcji obiektów, segmentacji semantycznej i estymacji głębi bez dostrajania (fine-tuningu) backbone’u. Wagi i kod udostępniono na licencji DINOv3 poprzez GitHub (facebookresearch/dinov3) oraz Hugging Face.

Klasyfikacja
Model wzrokowy
Rodzina: DINO
Dostęp i wdrożenie
Pobieranie
LokalnieChmura
Wagi: Open weights
Kluczowe parametry
🧩 Parametry: 6.7B (ViT-7B); warianty destylowane 21M–840M
✓ Fine-tuning
📥 Wejście: obraz

Specyfikacja techniczna

Parametry
6.7B (ViT-7B); warianty destylowane 21M–840M
parametrów
Licencja
DINOv3 License
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
image
⬆ Wyjście (Output)
structured_data

Wyniki benchmarków

2 benchmarki
ImageNet-1k
k-NN accuracy · frozen backbone k-NN
82.0%
📄 repository
ViT-L/16
ImageNet-1k
linear probe accuracy · frozen backbone linear eval
83.5%
📄 repository
ViT-L/16

Architektura techniczna

Rdzeń architektury (Core Architecture)
Forma modelu (Model Form)
Techniki trenowania (Training Techniques)