Ускорение поиска генетического сходства в древе жизни
Исследователи из Института биологии развития Общества Макса Планка в Тюбингене и Центра вычислительных ресурсов и данных Общества Макса Планка в Гархинге разработали новый высокоскоростной алгоритм для сравнения биохимического состава разных видов. Его сочетание точности и скорости не имеет аналогов.
Превосходя золотой стандарт
Стандартным инструментом для сравнения белковых последовательностей долгое время был BLAST. Однако с ростом объёмов данных — ожидается, что в ближайшее десятилетие будут секвенированы геномы более 1,5 миллионов эукариотических видов — поиск с помощью BLAST станет непрактичным из-за больших временных затрат.
Компромисс между скоростью и чувствительностью
Ранее команда разработала алгоритм DIAMOND, который работал значительно быстрее, но имел недостаток: он мог пропускать эволюционно отдалённые связи между последовательностями.
Новый мощный инструмент
Исследователям удалось модифицировать DIAMOND, сохранив его высокую скорость, но повысив чувствительность до уровня BLAST. Усовершенствованный алгоритм работает в 80–360 раз быстрее BLAST при сопоставимой точности.
Ключевые преимущества нового DIAMOND:
- Позволяет проводить выравнивания с чувствительностью BLAST на суперкомпьютерах, высокопроизводительных кластерах или в облаке с массовым параллелизмом.
- Запросы, которые другими инструментами выполнялись бы два месяца на суперкомпьютере, теперь можно выполнить за несколько часов.
Этот инструмент станет критически важным для анализа растущего массива геномных данных, позволяя изучать всю совокупность доступных геномов, а не ограничиваться небольшим числом видов.
