Zespół z Instytutu Weizmanna przedstawił Brain-IT — system rekonstruujący oglądany obraz na podstawie skanu fMRI, któremu do kalibracji wystarcza godzina nagrań nowej osoby zamiast czterdziestu godzin. Pracę przyjęto na ICLR 2026, a 1 października 2026 opisał ją MIT Technology Review. Próg wejścia dla badań nad dekodowaniem widzenia spada o rząd wielkości.
Najważniejsze w skrócie
- Godzina danych fMRI nowej osoby daje wyniki porównywalne z metodami trenowanymi na 40 godzinach
- Dekoder rozdziela zadanie na strukturę niskopoziomową i cechy semantyczne
- Około 70 proc. danych treningowych nigdy nie było sparowane ze skanami, według MIT Technology Review
- Osiem osób, około 9 tys. obrazów na osobę podczas skanowania
- Rozdzielczość voxela spadła z 3 do 1 mm sześciennego — wcześniej jeden voxel obejmował ok. 16 tys. neuronów
Dwie gałęzie zamiast jednej
Wcześniejsze systemy próbowały wyprowadzić obraz z jednej reprezentacji, przez co mieszały „co widać" z „jak to wygląda". Brain-IT rozdziela te sygnały: jedna ścieżka przewiduje cechy semantyczne na poziomie fragmentów obrazu, druga — strukturę niskopoziomową, czyli układ, kontury i barwy. Dopiero obie razem sterują generatorem.
Diagram pokazuje kolejność etapów, nie proporcje obliczeń. Rozdzielenie na dwie gałęzie jest sednem metody: pojedynczy dekoder musiał dotąd jednocześnie zgadywać treść sceny i jej geometrię, co przy słabym sygnale psuło oba zadania naraz.
Spoiwem jest Transformer interakcji mózgowych, od którego pochodzi nazwa. Zamiast traktować aktywność jako płaski wektor, model pozwala grupom voxeli?Voxel: Najmniejsza kostka objętości, jaką rozróżnia skaner. Im mniejsza, tym mniej neuronów uśrednia się w jednym pomiarze. wymieniać informacje, co ma odwzorować to, że sąsiadujące obszary kory kodują powiązane fragmenty sceny.
Godzina w skanerze zamiast czterdziestu
Najmocniejszym wynikiem nie jest jakość rekonstrukcji, tylko koszt kalibracji. Czterdzieści godzin w skanerze to bariera, która ogranicza badania do garstki ochotników — głównie samych badaczy. Godzina mieści się w jednej wizycie.
| Parametr | Metody wcześniejsze | Brain-IT |
|---|---|---|
| Kalibracja na nową osobę | 40 godzin w skanerze | 1 godzina |
| Rozdzielczość voxela | 3 mm sześcienne | 1 mm sześcienny |
| Dane treningowe bez sparowanego skanu | — | ok. 70 proc. |
| Uczestnicy badania | — | 8 osób, ok. 9 tys. obrazów każda |
Drogę skraca też to, że — jak podaje MIT Technology Review — około 70 proc. materiału treningowego stanowiły obrazy bez odpowiadających im skanów. Model uczy się więc świata osobno, a dopasowania do konkretnego mózgu — na małej próbce.
Dlaczego to ważne?
Dekodowanie obrazu z fMRI było dotąd demonstracją laboratoryjną, bo wymagało godzin leżenia w skanerze. Zbicie kalibracji do jednej sesji przenosi temat z kategorii ciekawostki do kategorii narzędzia badawczego, a przy okazji wymusza rozmowę o prywatności danych neuronalnych, zanim pojawi się jakakolwiek praktyka kliniczna czy komercyjna.
Co dalej?
- Praca została przyjęta na ICLR 2026, a wersja preprintu jest już dostępna na arXiv
- Rekonstrukcja wymaga skanera fMRI, więc zastosowania poza laboratorium pozostają poza zasięgiem
- Deklarowana poprawa rozdzielczości do 1 mm sześciennego pochodzi z relacji MIT Technology Review, nie z abstraktu pracy





