Robocikowo>ROBOCIKOWO
Sztuczna Inteligencja

Brain-IT odtwarza obraz z fMRI po godzinie zamiast czterdziestu

Pan Robocik11 października 2026 · 2 min czytania
Brain-IT odtwarza obraz z fMRI po godzinie zamiast czterdziestu

Zespół z Instytutu Weizmanna przedstawił Brain-IT — system rekonstruujący oglądany obraz na podstawie skanu fMRI, któremu do kalibracji wystarcza godzina nagrań nowej osoby zamiast czterdziestu godzin. Pracę przyjęto na ICLR 2026, a 1 października 2026 opisał ją MIT Technology Review. Próg wejścia dla badań nad dekodowaniem widzenia spada o rząd wielkości.

Najważniejsze w skrócie

  • Godzina danych fMRI nowej osoby daje wyniki porównywalne z metodami trenowanymi na 40 godzinach
  • Dekoder rozdziela zadanie na strukturę niskopoziomową i cechy semantyczne
  • Około 70 proc. danych treningowych nigdy nie było sparowane ze skanami, według MIT Technology Review
  • Osiem osób, około 9 tys. obrazów na osobę podczas skanowania
  • Rozdzielczość voxela spadła z 3 do 1 mm sześciennego — wcześniej jeden voxel obejmował ok. 16 tys. neuronów
1 h zamiast 40 hczas kalibracji potrzebny, by dostroić system do nowej osobyarXiv 2510.25976, ICLR 2026

Dwie gałęzie zamiast jednej

Wcześniejsze systemy próbowały wyprowadzić obraz z jednej reprezentacji, przez co mieszały „co widać" z „jak to wygląda". Brain-IT rozdziela te sygnały: jedna ścieżka przewiduje cechy semantyczne na poziomie fragmentów obrazu, druga — strukturę niskopoziomową, czyli układ, kontury i barwy. Dopiero obie razem sterują generatorem.

Pomiar
Skan fMRI podczas oglądania obrazuvoxele kory wzrokowej
Dekoder
Transformer interakcji mózgowychgrupy voxeli wymieniają informacje
Gałąź semantycznaco jest na obrazie
Gałąź strukturalnaukład, kontury, barwy
Generator obrazuAllow
Zrekonstruowany obrazporównywany z oryginałem
Droga od skanu do obrazu w Brain-IT

Diagram pokazuje kolejność etapów, nie proporcje obliczeń. Rozdzielenie na dwie gałęzie jest sednem metody: pojedynczy dekoder musiał dotąd jednocześnie zgadywać treść sceny i jej geometrię, co przy słabym sygnale psuło oba zadania naraz.

Spoiwem jest Transformer interakcji mózgowych, od którego pochodzi nazwa. Zamiast traktować aktywność jako płaski wektor, model pozwala grupom Voxel: Najmniejsza kostka objętości, jaką rozróżnia skaner. Im mniejsza, tym mniej neuronów uśrednia się w jednym pomiarze. wymieniać informacje, co ma odwzorować to, że sąsiadujące obszary kory kodują powiązane fragmenty sceny.

Godzina w skanerze zamiast czterdziestu

Najmocniejszym wynikiem nie jest jakość rekonstrukcji, tylko koszt kalibracji. Czterdzieści godzin w skanerze to bariera, która ogranicza badania do garstki ochotników — głównie samych badaczy. Godzina mieści się w jednej wizycie.

ParametrMetody wcześniejszeBrain-IT
Kalibracja na nową osobę40 godzin w skanerze1 godzina
Rozdzielczość voxela3 mm sześcienne1 mm sześcienny
Dane treningowe bez sparowanego skanu—ok. 70 proc.
Uczestnicy badania—8 osób, ok. 9 tys. obrazów każda
Myślnik oznacza wartość, której źródła nie podają dla metod wcześniejszych.

Drogę skraca też to, że — jak podaje MIT Technology Review — około 70 proc. materiału treningowego stanowiły obrazy bez odpowiadających im skanów. Model uczy się więc świata osobno, a dopasowania do konkretnego mózgu — na małej próbce.

Dlaczego to ważne?

Dekodowanie obrazu z fMRI było dotąd demonstracją laboratoryjną, bo wymagało godzin leżenia w skanerze. Zbicie kalibracji do jednej sesji przenosi temat z kategorii ciekawostki do kategorii narzędzia badawczego, a przy okazji wymusza rozmowę o prywatności danych neuronalnych, zanim pojawi się jakakolwiek praktyka kliniczna czy komercyjna.

Co dalej?

  • Praca została przyjęta na ICLR 2026, a wersja preprintu jest już dostępna na arXiv
  • Rekonstrukcja wymaga skanera fMRI, więc zastosowania poza laboratorium pozostają poza zasięgiem
  • Deklarowana poprawa rozdzielczości do 1 mm sześciennego pochodzi z relacji MIT Technology Review, nie z abstraktu pracy

Źródła

Udostępnij ten artykuł