Поиск паттернов в человеческих белках
Национальная исследовательская группа под руководством профессора инженерии Университета Коннектикута Сангутевара Раджасекарана разрабатывает новое поколение точных алгоритмов для помощи биологам в поиске паттернов в человеческих белках и ДНК. Эта работа может в перспективе привести к созданию новых лекарств для борьбы с заболеваниями.
Исследование поддержано грантом Национальных институтов здравоохранения (NIH) в размере $1.5 млн на четыре года. Средства позволят ученым разработать новые алгоритмы для анализа геномов на предмет сложных, биологически значимых паттернов, называемых «мотивами».
«Генетический анализ и другие подходы выявили множество мутаций, часто обнаруживаемых в кодирующих белок регионах, которые связаны с наследственными заболеваниями человека», — говорит Раджасекаран, главный исследователь по гранту. — «Если мы сможем найти препарат, воздействующий на белок, содержащий мутацию, мы сможем разработать эффективное лечение. Анализ последовательностей белков и ДНК — важный подход для предсказания функции белка и, следовательно, важная часть процесса открытия лекарств».
В команду также входят профессор Реда А. Аммар и другие ученые из Университета Флориды и Университета Невады в Лас-Вегасе.
Проблема и цель
Суперкомпьютеры и эффективные алгоритмы стали ключевыми инструментами для биологов, обрабатывающих огромные массивы данных, созданных в рамках проекта «Геном человека». Поиск повторяющихся в геномах паттернов (мотивов) — один из способов выявления полезной информации. Например, если определенный мотив найден в белке, подавляющем развитие болезни, а его мутация обнаружена у больных, можно разработать лекарства, воздействующие на этот процесс.
Однако существующие алгоритмы для такого поиска сложны и требуют много вычислительного времени и памяти. По словам Раджасекарана, поиск мотивов длиной 27 с использованием лучших известных алгоритмов может занять более месяца на обычном ПК, а для мотивов длиной 31 и более — более 5 лет. Биологам нужны алгоритмы, способные быстро и надежно находить такие длинные и сложные мотивы. Чем длиннее и сложнее найденный мотив, тем он полезнее и тем меньше вероятность ложных срабатываний.
Разработка новых инструментов
«Наша роль — сделать процесс быстрее и эффективнее при работе в реальном времени», — говорит Аммар. — «Мы создаем инструменты, которые должны быть удобными и простыми в использовании для не-технических специалистов».
Ранее члены команды создали веб-инструмент Minimotif Miner для поиска мотивов, которым сейчас пользуются биологи по всему миру. Новый грант позволит разработать веб-систему, включающую три варианта задачи: поиск «посаженного» мотива, поиск мотива с учетом редакционного расстояния и простой поиск мотива.
Новые алгоритмы помогут биологам находить высоконадежные короткие участки геномных последовательностей среди огромного числа возможных вариантов. Это похоже на указание ученым на нужные полки в библиотеке с миллионами книг.
«Можно взглянуть на полные геномные последовательности здоровых людей и сравнить их с таковыми у больных раком. Там могут быть миллионы различий, потому что эти геномы огромны», — объясняет Раджасекаран. — «Вот почему мы нацелены на мутации в мотивах — они очень фундаментальны и играют ключевую роль в белково-белковых взаимодействиях».
Биолог Мартин Шиллер, со-разработчик Minimotif Miner, сравнивает исследования алгоритмов и мотивов с попытками ученых понять иероглифы:
«У нас есть вся эта информация, которая предстает перед нами в виде символов, но у нас нет ключа для шифра, Розеттского камня. Мы пытаемся упорядочить вещи, чтобы извлечь значимую информацию. С помощью поиска паттернов мы извлекаем правила жизни из генома и выясняем, что они значат».
