Улучшенный метод сравнения белковых последовательностей стал быстрее, точнее и чувствительнее

Исследователи из Центра генома LMU под руководством доктора Йоханнеса Сёдинга разработали новый программный инструмент HHblits для поиска схожих белковых последовательностей в базах данных. Метод работает значительно быстрее и обнаруживает вдвое больше эволюционно родственных белков по сравнению с предыдущими подходами.

Как работает анализ последовательностей

  • Функции и структура белка определяются последовательностью его 20 аминокислотных "кирпичиков".
  • Сравнивая последовательность изучаемого белка с миллионами последовательностей в публичных базах данных (например, PDB, GenBank), можно предсказать его эволюционное родство, а значит, и схожую структуру с функциями.
  • Особенно важны множественные выравнивания последовательностей (multiple sequence alignments), где схожие последовательности многих родственных белков выстраиваются в матрицу. Это основа для предсказания структуры и функций неизученных белков.

Превосходство HHblits над PSI-BLAST

В течение 15 лет самым популярным инструментом для сравнения был PSI-BLAST. HHblits превосходит его по всем параметрам благодаря двум ключевым инновациям:

  1. Использование скрытых марковских моделей (Hidden Markov Models, HMMs): Последовательности преобразуются в статистические модели, учитывающие вероятности мутаций, что повышает чувствительность и точность поиска.
  2. Новый метод фильтрации данных: Схожие последовательности из базы данных сначала объединяются в множественные выравнивания. Каждая колонка выравнивания кодируется одним из 219 "букв" в зависимости от состава аминокислот. Это позволяет заменить трудоёмкое попарное сравнение HMM на быстрое сравнение простых последовательностей из 219 букв.

Результат: Время поиска сокращается в 2500 раз без потери чувствительности.

Значение метода

Как отмечает Йоханнес Сёдинг: "HHblits позволяет предсказывать функцию и структуру белков чаще и точнее, чем это было возможно ранее". Это расширяет возможности биоинформатического анализа и облегчает экспериментальное изучение белков. Группа Сёдинга уже работает над дальнейшим улучшением метода, например, за счёт включения информации о трёхмерных структурах белков.

2011-12-25