Как мозг распознаёт речь: новая математическая модель для компьютеров
Исследователи из Института когнитивных наук и наук о мозге им. Макса Планка в Лейпциге и Центра нейровизуализации Wellcome Trust в Лондоне разработали математическую модель, которая может значительно улучшить автоматическое распознавание и обработку устной речи. Модель имитирует предполагаемые мозговые механизмы восприятия.
Проблема современных систем
Существующие компьютерные системы распознавания речи часто дают сбои при малейших изменениях в темпе речи, чёткости произношения или наличии фонового шума. Они полагаются на анализ характерных особенностей в частотах голоса, что делает их чувствительными к помехам.
Гипотеза иерархического восприятия
Учёные предполагают, что мозг использует другой подход, основанный на анализе временных последовательностей:
- Воспринимаемые стимулы (музыка, речь) состоят из последовательностей разной длины, иерархически упорядоченных.
- Мозг классифицирует сигналы — от мелких, быстро меняющихся компонентов (отдельные звуки, например, «э» или «у») до крупных, медленно меняющихся элементов (например, тема разговора).
- Мозг постоянно ищет временную структуру, чтобы предсказать, что произойдёт дальше. Например, при теме «жаркое лето» последовательность «су…» с большей вероятностью будет началом слова «солнце», чем «ужин».
Суть модели
Исследователи создали упрощённую математическую модель, имитирующую нейронные процессы понимания речи:
- Нейронные процессы описаны алгоритмами, обрабатывающими речь на нескольких временных уровнях.
- Модель успешно распознавала отдельные речевые звуки и слоги.
- В отличие от других систем, она могла обрабатывать ускоренные речевые последовательности.
- Модель обладала способностью к предсказанию следующего звука и могла обнаруживать ошибку, если предсказание оказывалось неверным.
Тестирование и перспективы
Модель тестировали на упрощённом «языке», состоящем из четырёх гласных (a, e, i, o), которые комбинировались в «слоги» из четырёх звуков. В будущем в модель можно включить согласные звуки и добавить иерархические уровни для слов и предложений, чтобы приблизить её к обработке естественного языка.
Ключевой вывод: реакции модели были аналогичны наблюдаемым в человеческом мозге, что указывает на её нейробиологическую достоверность. Одновременно модель открывает новые подходы для практического применения в области искусственного распознавания речи.
Источник: Stefan J. Kiebel, Katharina von Kriegstein, Jean Daunizeau, Karl J. Friston; Recognizing sequences of sequences; PLoS Computational Biology, 14 августа 2009.
