Robocikowo>ROBOCIKOWO
Dane

SAYCam

2020AktywnyOpublikowano: 25 sierpnia 2026Aktualizacja: 25 sierpnia 2026Opublikowany
Podłużny zbiór egocentrycznych nagrań wideo z kamer noszonych na głowie przez troje małych dzieci (S, A, Y), rejestrujący ich doświadczenie wzrokowe i językowe.
Kluczowa innowacja
Pierwszy duży, podłużny zbiór egocentrycznych nagrań audiowizualnych rejestrowanych z perspektywy małego dziecka, pozwalający trenować i testować modele AI na danych zbliżonych do rzeczywistego doświadczenia rozwojowego człowieka.
Kategoria
Dane
Poziom abstrakcji
Building block
Poziom operacji
DaneTrening
Zastosowania
Uczenie rozwojowo prawdopodobne (developmentally plausible learning)Ugruntowane uczenie języka (grounded language learning)Samonadzorowane uczenie reprezentacji wizualnychUczenie multimodalne (obraz + mowa)Uczenie mapowań słowo–desygnat (word learning)Badanie hipotezy ubóstwa bodźca (poverty of the stimulus)Badania nad efektywnością danych (data efficiency)Badania rozwoju poznawczego i języka u dzieci

Jak działa

Troje dzieci nosiło lekką kamerę zamontowaną na głowie, która rejestrowała obraz i dźwięk z ich perspektywy podczas codziennych czynności, mniej więcej 2 godziny tygodniowo przez około 2,5 roku (wiek ~6–32 miesięcy). Nagrania zostały przetworzone: mowę stranskrybowano (ponad 200 000 słów), a materiał opatrzono metadanymi umożliwiającymi przeszukiwanie według wieku, lokalizacji, otoczenia i obiektów. Dane zdeponowano w Databrary z kontrolą dostępu. Badacze wykorzystują klatki wideo i sparowane transkrypcje mowy do trenowania modeli (np. samonadzorowanych sieci wizyjnych lub multimodalnych modeli kontrastowych łączących obraz z mową skierowaną do dziecka).

Rozwiązany problem

Modele AI są zwykle trenowane na ogromnych, wyselekcjonowanych zbiorach z internetu, całkowicie niepodobnych do strumienia danych, z którego uczy się dziecko. Brakowało realistycznych, podłużnych danych o tym, co faktycznie widzi i słyszy uczące się dziecko, aby badać, czego można się nauczyć z takiego naturalnego, ograniczonego wejścia.

Komponenty

Nagrania dziecka S (SAYCam-S)Podzbiór danych jednego dziecka

Najobszerniejszy i najczęściej wykorzystywany podzbiór, zawierający egocentryczne nagrania dziecka oznaczonego inicjałem S.

Nagrania dziecka A (SAYCam-A)Podzbiór danych jednego dziecka

Podzbiór egocentrycznych nagrań dziecka oznaczonego inicjałem A.

Nagrania dziecka Y (SAYCam-Y)Podzbiór danych jednego dziecka

Podzbiór egocentrycznych nagrań dziecka oznaczonego inicjałem Y.

Labeled-SZbiór ewaluacyjny

Ewaluacyjny podzbiór klatek z nagrań dziecka S, ręcznie opatrzony etykietami kategorii, używany do testowania klasyfikacji i mapowań słowo–desygnat.

Transkrypcje mowyWarstwa językowa danych

Ponad 200 000 stranskrybowanych słów mowy zarejestrowanej w otoczeniu dziecka, sparowanych czasowo z materiałem wideo.

Ewolucja

Oryginalny paper · 2020 · Open Mind · Jessica Sullivan
SAYCam: A Large, Longitudinal Audiovisual Dataset Recorded From the Infant's Perspective
Jessica Sullivan, Michelle Mei, Andrew Perfors, Erica H. Wojcik, Michael C. Frank
2020
Publikacja i udostępnienie zbioru SAYCam
Punkt przełomowy

Sullivan i współpracownicy opisują SAYCam w czasopiśmie Open Mind i deponują dane w repozytorium Databrary z kontrolą dostępu.

2020
Samonadzorowane modele wizyjne trenowane na SAYCam

Emin Orhan i współpracownicy pokazują, że użyteczne reprezentacje wizualne można wyuczyć samonadzorowo z nagrań SAYCam (modele TC-S/A/Y/SAY).

2024
CVCL uczy się języka z danych jednego dziecka
Punkt przełomowy

Vong i współpracownicy trenują multimodalny model kontrastowy CVCL na ok. 61 godzinach nagrań jednego dziecka (wiek ~6–25 miesięcy), ucząc się mapowań słowo–desygnat i wykazując generalizację zero-shot; praca opublikowana w Science.