ИИ научился воссоздавать изображения, которые видит человек, по снимкам его мозга
Исследователи из Научного института Вайцмана в Израиле разработали ИИ-инструмент, который по снимку мозга воссоздаёт то, на что смотрел человек. Он работает и в обратную сторону, то есть может предсказывать активность мозга по картинке. Об этом сообщает MIT Technology Review.
Для этого ученые использовали открытые данные функциональной магнитно-резонансной томографии (фМРТ). Метод отслеживает движение насыщенной кислородом крови в мозге — области, которые «загораются» на снимке, считаются самыми активными. Обычно один элемент снимка (воксель) охватывает около трёх кубических миллиметров ткани, в каждом кубическом миллиметре примерно 16 тысяч нейронов. Исследователи взяли данные томографов с более высоким разрешением, где воксель покрывает около одного кубического миллиметра. Прежние модели тоже умели воссоздавать изображения по снимкам мозга, но результат получался неточным. По словам Мишаль Ирани, если человек видел банан, нейросеть нарисует банан, но с другой структурой и в другом положении.
Декодер обучили на данных восьми добровольцев, которым показывали по 9 тысяч изображений. У него две ветви: одна предсказывает структуру картинки, например расположение цветов, другая — её содержание, например связку бананов на тарелке. На основе этих предсказаний диффузионная модель, тип ИИ, который создаёт изображения, постепенно очищая «шум» из пикселей, строит итоговую картинку. Данных для обучения не хватало, поэтому команда добавила энкодер, предсказывающий снимок мозга по изображению. Он создаёт для декодера новые обучающие примеры, декодер пытается по ним восстановить картинку, и обе модели улучшают друг друга. Благодаря этому около 70% обучающих данных составили изображения, которые никому не показывали в томографе.
Объединив данные нескольких исследований, учёные нашли области мозга с общими функциями у разных людей. Одна реагировала на изображения еды, другая — на спорт. Получившийся «универсальный энкодер мозга» можно применять к новому человеку почти без калибровки: ему нужен один час фМРТ вместо обычных 40. Результаты представили на конференции по когнитивной вычислительной нейробиологии в Нью-Йорке в сентябре. Нейробиолог Томми Спрэг из Калифорнийского университета в Санта-Барбаре отметил, что час томографии стоит от 600 до 1000 долларов, поэтому такие инструменты могут ускорить исследования. Ошибки у модели тоже бывают: торт она показала как три сэндвича, а собаку в ванне — как козу похожего цвета. Тем не менее в сравнении с другими инструментами разработка, по словам Ирани, значительно их опередила.
Дальше исследователи хотят перейти от изображений к видео и аудио. Ирани мечтает научиться воссоздавать то, о чём человек думает или что представляет, и даже содержание его снов, но пока этого нет. Такая технология могла бы помочь полностью парализованным людям общаться с помощью активности мозга. Она также позволила бы заглянуть в то, как выглядят, например, флешбэки при посттравматическом стрессовом расстройстве. Нейроэтик Джуди Иллес из Университета Британской Колумбии, не участвовавшая в работе, назвала её «великолепной».
Эксперты предупреждают о рисках для приватности. Сейчас заставить человека неосознанно лежать в томографе почти нереально, но Ирани и другие учёные работают над подобными методами для ЭЭГ, где активность мозга измеряют электродами, в том числе и через наушники. По мнению Марчелло Иенки из Мюнхенского технического университета, переход к ЭЭГ изменит всё: компании смогут получать дополнительную информацию из мозга пользователя без его согласия, а суды — принимать реконструкции мысленных образов как доказательства. Спрэг считает, что подход Ирани, вероятно, сработает и для образов, о которых человек только думает. Сама Ирани признаёт риск злоупотреблений, но пока не тревожится: «Я стараюсь думать только о хорошем».
H_Ko / Shutterstock / Fotodom