Улучшенный метод сравнения белковых последовательностей стал быстрее, точнее и чувствительнее
Исследователи из Центра генома LMU под руководством доктора Йоханнеса Сёдинга разработали новый программный инструмент HHblits для поиска схожих белковых последовательностей в базах данных. Метод работает значительно быстрее и обнаруживает вдвое больше эволюционно родственных белков по сравнению с предыдущими подходами.
Как работает анализ последовательностей
- Функции и структура белка определяются последовательностью его 20 аминокислотных "кирпичиков".
- Сравнивая последовательность изучаемого белка с миллионами последовательностей в публичных базах данных (например, PDB, GenBank), можно предсказать его эволюционное родство, а значит, и схожую структуру с функциями.
- Особенно важны множественные выравнивания последовательностей (multiple sequence alignments), где схожие последовательности многих родственных белков выстраиваются в матрицу. Это основа для предсказания структуры и функций неизученных белков.
Превосходство HHblits над PSI-BLAST
В течение 15 лет самым популярным инструментом для сравнения был PSI-BLAST. HHblits превосходит его по всем параметрам благодаря двум ключевым инновациям:
- Использование скрытых марковских моделей (Hidden Markov Models, HMMs): Последовательности преобразуются в статистические модели, учитывающие вероятности мутаций, что повышает чувствительность и точность поиска.
- Новый метод фильтрации данных: Схожие последовательности из базы данных сначала объединяются в множественные выравнивания. Каждая колонка выравнивания кодируется одним из 219 "букв" в зависимости от состава аминокислот. Это позволяет заменить трудоёмкое попарное сравнение HMM на быстрое сравнение простых последовательностей из 219 букв.
Результат: Время поиска сокращается в 2500 раз без потери чувствительности.
Значение метода
Как отмечает Йоханнес Сёдинг: "HHblits позволяет предсказывать функцию и структуру белков чаще и точнее, чем это было возможно ранее". Это расширяет возможности биоинформатического анализа и облегчает экспериментальное изучение белков. Группа Сёдинга уже работает над дальнейшим улучшением метода, например, за счёт включения информации о трёхмерных структурах белков.
