Как мозг распознаёт речь: новая математическая модель для компьютеров

Исследователи из Института когнитивных наук и наук о мозге им. Макса Планка в Лейпциге и Центра нейровизуализации Wellcome Trust в Лондоне разработали математическую модель, которая может значительно улучшить автоматическое распознавание и обработку устной речи. Модель имитирует предполагаемые мозговые механизмы восприятия.

Проблема современных систем

Существующие компьютерные системы распознавания речи часто дают сбои при малейших изменениях в темпе речи, чёткости произношения или наличии фонового шума. Они полагаются на анализ характерных особенностей в частотах голоса, что делает их чувствительными к помехам.

Гипотеза иерархического восприятия

Учёные предполагают, что мозг использует другой подход, основанный на анализе временных последовательностей:

  • Воспринимаемые стимулы (музыка, речь) состоят из последовательностей разной длины, иерархически упорядоченных.
  • Мозг классифицирует сигналы — от мелких, быстро меняющихся компонентов (отдельные звуки, например, «э» или «у») до крупных, медленно меняющихся элементов (например, тема разговора).
  • Мозг постоянно ищет временную структуру, чтобы предсказать, что произойдёт дальше. Например, при теме «жаркое лето» последовательность «су…» с большей вероятностью будет началом слова «солнце», чем «ужин».

Суть модели

Исследователи создали упрощённую математическую модель, имитирующую нейронные процессы понимания речи:

  • Нейронные процессы описаны алгоритмами, обрабатывающими речь на нескольких временных уровнях.
  • Модель успешно распознавала отдельные речевые звуки и слоги.
  • В отличие от других систем, она могла обрабатывать ускоренные речевые последовательности.
  • Модель обладала способностью к предсказанию следующего звука и могла обнаруживать ошибку, если предсказание оказывалось неверным.

Тестирование и перспективы

Модель тестировали на упрощённом «языке», состоящем из четырёх гласных (a, e, i, o), которые комбинировались в «слоги» из четырёх звуков. В будущем в модель можно включить согласные звуки и добавить иерархические уровни для слов и предложений, чтобы приблизить её к обработке естественного языка.

Ключевой вывод: реакции модели были аналогичны наблюдаемым в человеческом мозге, что указывает на её нейробиологическую достоверность. Одновременно модель открывает новые подходы для практического применения в области искусственного распознавания речи.

Источник: Stefan J. Kiebel, Katharina von Kriegstein, Jean Daunizeau, Karl J. Friston; Recognizing sequences of sequences; PLoS Computational Biology, 14 августа 2009.

2009-08-14