Язык формирует визуальную обработку в мозге человека и моделях ИИ
Исследователи из Пекинского университета, Пекинского педагогического университета и других институтов Китая, сравнивая обработку информации глубокими нейронными сетями (DNNs) и человеческим мозгом, пролили новый свет на основы визуальной обработки. Их работа, опубликованная в Nature Human Behavior, показывает, что язык активно формирует обработку визуальной информации как в мозге, так и в мультимодальных DNNs.
Сравнение ИИ и человеческого зрения
В исследовании тестировались три модели:
- CLIP — модель, обучающаяся связывать изображения с текстовыми описаниями.
- ResNet — модель компьютерного зрения, обученная на размеченных изображениях.
- MoCo — модель компьютерного зрения, обученная на немаркированных данных.
Их предсказания сравнивались с реакцией человеческого мозга на те же задачи. Также были обследованы 33 пациента, перенесших инсульт, который повредил связи между областями мозга, ответственными за визуальную обработку и язык.
«Недавние исследования показали лучшее соответствие моделей "зрение–язык", таких как CLIP, активности затылочно-височной коры (VOTC) человека, чем более ранних моделей зрения, что поддерживает идею о модуляции языка в человеческом зрительном восприятии», — пишут авторы.
Ключевые результаты
- CLIP лучше отражала активность VOTC — области мозга, участвующей в распознавании объектов и категорий, — чем модели ResNet и MoCo, что наблюдалось на четырёх различных наборах данных.
- Это преимущество было латерализовано в левом полушарии на групповом уровне, что соответствует расположению языковой сети человека.
- У пациентов с инсультом снижение целостности белого
вещества между VOTC и языковой областью в левой угловой
извилине коррелировало с:
- Уменьшением соответствия между активностью мозга и моделью CLIP.
- Увеличением соответствия с моделью MoCo.
«Эти данные свидетельствуют о динамическом влиянии языковой обработки на активность VOTC», — заключают исследователи.
Значение для нейронауки и ИИ
Результаты подтверждают, что язык играет центральную роль в обработке мозгом визуальной информации. Это поддерживает интеграцию языковой модуляции в нейрокогнитивные модели человеческого зрения.
Работа также предлагает перспективный подход:
«Чувствительность сходства "модель–мозг" к конкретным поражениям мозга демонстрирует, что использование манипуляций с человеческим мозгом является многообещающей основой для оценки и разработки подобных мозгу компьютерных моделей».
Это может вдохновить на создание новых мультимодальных моделей ИИ и углубить понимание как нормальных когнитивных процессов, так и их нарушений при различных заболеваниях.
