Разработчики решают давнюю проблему нейроинтерфейсов: когда ИИ верно угадывает объекты на картинке, но путает их расположение или цвета. Brain-IT преобразует 40 тысяч вокселей данных fMRI в 128 функциональных кластеров. Из них извлекаются «мозговые токены», которые разделяются на два потока. Первый определяет смысл сцены для диффузионной модели, а второй отвечает за геометрию и композицию. В результате система создает черновой набросок, который затем детализируется согласно семантическому описанию.
В тестах на наборе данных Natural Scenes Dataset новая архитектура обошла предыдущего лидера MindEye2 по семи из восьми метрик. Показатель структурного сходства SSIM достиг 0,486, а корреляция пикселей выросла до 0,386. Особое достижение — скорость адаптации: для получения качественной реконструкции Brain-IT требуется в 40 раз меньше данных, чем прежним методам. Даже при 15-минутной записи модель выдает узнаваемые образы, хотя всё ещё допускает ошибки в мелких деталях.
Анализ механизма внимания показал любопытную деталь: отдельные токены модели специализируются на конкретных типах объектов, например, на лицах или тексте. Это не означает создание полной карты зрительной коры, но подтверждает, что нейросеть научилась эффективно извлекать визуальные признаки из зашумленного сигнала мозга.

Комментарии (0)
Пока нет комментариев. Будьте первым!