Математические алгоритмы стандартизируют анализ геномных данных

Исследователи из Сингапура разработали математические алгоритмы для анализа данных высокопроизводительного секвенирования генома. Эти алгоритмы точнее и надежнее существующих методов и могут определять местоположение и активность конкретных нуклеотидных последовательностей в широком спектре методов, выявляющих взаимодействия генов и белков.

Проблема существующих методов

Бурное развитие высокопроизводительного секвенирования потребовало создания биоинформатических методов для анализа огромных объемов данных. Каждая специализированная методика секвенирования (для определения активности генов, метилирования ДНК, связывания микроРНК и т.д.) породила собственные узкоспециализированные аналитические методы, часто основанные на эвристике — практических стратегиях, которые работают, но требуют оптимизации.

Новый подход

Группа Шьяма Прабхакара из A*STAR Genome Institute of Singapore поняла, что почти все анализы секвенирования сводятся к двум классическим задачам обработки сигналов: обнаружение сигнала и оценка силы сигнала. Исследователи адаптировали для анализа секвенирования стандартные математические методы решения этих задач. Формальная математическая основа позволяет оптимизировать эти методы и применять единый подход для широкого круга задач, что облегчает интеграцию данных.

Разработанные алгоритмы

  • DFilter — для обнаружения и локализации связывания регуляторных белков с геномом.
  • EFilter — для оценки активности генов по уровням матричной РНК (mRNA).

Результаты тестирования

При тестировании на нескольких технологиях секвенирования оба алгоритма превзошли по эффективности существующие специализированные методы. Новые алгоритмы также облегчили анализ и сравнение множественных и разнородных наборов данных.

Практическое применение

Исследователи успешно применили свои алгоритмы для анализа сложной, гетерогенной ткани переднего мозга эмбриона мыши. Они смогли выявить функционирующие факторы транскрипции и получить полезные данные, несмотря на невозможность привязать отдельные факторы к конкретным типам клеток.

Планы на будущее

«Мы намерены сделать DFilter и EFilter широко доступными, возможно, через поставщиков облачной геномики, если все пойдет по плану», — говорит Прабхакар.

2013-09-11