Robocikowo>ROBOCIKOWO
SAM 2

SAM 2

2 (Segment Anything Model 2) · Rodzina: Segment Anything (SAM)
Otwarty (Apache 2.0) model fundamentalny Meta do promptowalnej segmentacji i sledzenia obiektow w obrazach i wideo, w czasie rzeczywistym; enkoder Hiera + pamiec strumieniowa.
✓ Aktywny✓ Publiczny dostęp⚖ Open sourceModel wzrokowyWyspecjalizowane AI📁 Segment Anything (SAM)
Parametry
Warianty: tiny/small/base+/large (Hiera). Sam2-hiera-large ~224M.
parametrów
Data premiery
29 lipca 2024
Dostęp:DownloadAPIHostedWdrożenie:💻 Lokalnie☁ Cloud

Przegląd

SAM 2 (Segment Anything Model 2) to model fundamentalny opracowany przez Meta AI (FAIR), udostepniony 29 lipca 2024 roku. To zunifikowany model do promptowalnej segmentacji i sledzenia obiektow w czasie rzeczywistym - zarowno w obrazach, jak i w wideo. Stanowi kontynuacje SAM, ktory dzialal tylko na obrazach.

Uzytkownik wskazuje obiekt podpowiedzia (punkt, ramka lub maska) na dowolnej klatce, a model generuje jego maske pikselowa i propaguje ja przez cala sekwencje wideo (segmentacja + sledzenie). Architektura obejmuje enkoder obrazu Hiera (hierarchiczny Vision Transformer), enkoder podpowiedzi, dekoder masek oraz modul pamieci strumieniowej. Model cechuje sie generalizacja zero-shot do wczesniej niewidzianych obiektow.

SAM 2 udostepniono na permisywnej licencji Apache 2.0 wraz z datasetem SA-V (okolo 51 tys. filmow i ponad 600 tys. masklets). Model dostepny jest m.in. przez Hugging Face oraz repozytorium GitHub (facebookresearch/sam2), a takze na Amazon SageMaker JumpStart (jako Segment Anything 2.1). Wystepuje w wariantach roznej wielkosci (tiny/small/base/large).

Klasyfikacja
Model wzrokowyWyspecjalizowane AI
Dostęp i wdrożenie
PobieranieAPIHostowane
LokalnieChmura
Wagi: Open source
Kluczowe parametry
🧩 Parametry: Warianty: tiny/small/base+/large (Hiera). Sam2-hiera-large ~224M.
✓ Fine-tuning
📥 Wejście: obraz, wideo, dane strukturalne

Specyfikacja techniczna

Parametry
Warianty: tiny/small/base+/large (Hiera). Sam2-hiera-large ~224M.
parametrów
Licencja
Apache 2.0
Wymagania sprzętowe
Warianty od tiny (mobilne/edge) po large; enkoder ViT (Hiera) korzysta z GPU. Obsluga: PyTorch, Transformers. Inferencja wideo w czasie zblizonym do rzeczywistego.
Funkcje:Fine-tuning
Modalności
⬇ Wejście (Input)
imagevideostructured_data
⬆ Wyjście (Output)
imagestructured_data

Możliwości i zastosowania

Natywne możliwości modelu
Segmentacja obrazu
Zdolnosc do wyodrebniania obiektow lub obszarow na obrazie przez generowanie masek pikselowych (np. na podstawie punktow, ramek lub innych podpowiedzi).
Kategoria: vision
Sledzenie obiektow (wideo)
Zdolnosc do sledzenia wybranych obiektow w kolejnych klatkach wideo, w tym utrzymywania ich masek/tozsamosci mimo ruchu, przeslon i zmian wygladu.
Kategoria: vision
Rozumienie obrazu
Analiza i interpretacja treści obrazów.
Kategoria: vision
Rozumienie wideo
Zdolność modelu do analizy i interpretacji treści wideo — rozpoznawania akcji, ruchu, zdarzeń oraz relacji między obiektami w czasie.
Kategoria: video

Cennik

Architektura techniczna

Rdzeń architektury (Core Architecture)

Wdrożenie i bezpieczeństwo

☁ Dostępny na platformach
🔒 Security / Enterprise
✓ Zweryfikowane informacje enterprise

Model open-source na licencji Apache 2.0 - pelna swoboda self-hostingu / on-premises z kontrola danych (przetwarzanie lokalne, bez wysylania obrazow/wideo do chmury).

Aktualizacja: 31 lip 2026↗ Dokumentacja security