Учёные создали программу для поиска синтенных блоков у разных животных
Современная генетика подразумевает работу с огромными объёмами данных, которые невозможно обработать без сложных математических алгоритмов. Поэтому разработка специальных программ для обработки не менее важна для биоинформатиков, чем секвенирование геномов конкретных животных. Международная команда учёных, включая исследователей из Университета ИТМО, создала программный инструмент, позволяющий быстро и эффективно находить схожие участки в геномах разных животных. Это важно для понимания, насколько близкородственны два вида и как далеко они эволюционировали от общего предка. Исследование опубликовано в GigaScience.
Разнообразие миллионов биологических видов на Земле заложено на генетическом уровне. Анатомия, размер, окраска и повадки животных определяются их генами. При этом разнообразие самих генов не так велико: на сегодня учёные идентифицировали лишь немногим более 20 000 генов. Поэтому виды различаются не только наборами генов, но и тем, как эти гены расположены. В языке сравнительной геномики это называется синтения — порядок расположения генов и регуляторных элементов.
«Возьмём, к примеру, гориллу и шимпанзе, — говорит Ксения Крашенинникова, исследователь и инженер Университета ИТМО. — У этих двух видов одинаковый набор генов, но их регуляторные элементы и мутации в геноме создают немного разный порядок, что и приводит к различиям между этими приматами».
Таким образом, чтобы понять эволюционную близость видов, учёным нужно знать не только их гены, но и то, как они расположены в хромосоме, и сколько существует общих фрагментов генома — синтенных блоков. Находить их вручную невозможно: объём данных слишком велик. Геномы млекопитающих состоят из миллионов и миллиардов пар оснований, что делает обработку без технологий больших данных практически невыполнимой. Поэтому учёные создают собственные программы для решения новых задач, возникающих по мере развития науки. Этим и занялась команда, в которую вошли специалисты из Лаборатории геномного разнообразия ИТМО.
Новый программный инструмент назвали halSynteny. По словам авторов, он может искать синтенные блоки лучше и быстрее, чем другие программы, созданные для этой цели. Более того, halSynteny работает с данными в двух стандартных и хорошо документированных форматах.
«Наша цель — создать алгоритм, который можно было бы легко применить к доступным данным, — говорит Ксения, первый автор исследования. — Некоторые подходы к идентификации синтенных последовательностей основаны на предварительной аннотации генов; наш метод другой. Мы не используем никакой дополнительной аннотации. Мы используем метод выравнивания, когда разные части одного генома сравниваются по степени сходства с частями другого генома. Таким образом мы можем идентифицировать однородные участки, имеющие общее происхождение».
Программа позволяет ускорить вычисления более чем в два раза по сравнению с другим популярным инструментом — SatsumaSynteny2. Такая высокая эффективность достигнута за счёт реализации математически эффективного алгоритма на C++.
Предложенный метод и программный инструмент были протестированы путём сравнения геномов кошки и собаки.
«Мы показали, что крупные фрагменты хромосом кошки и некоторые фрагменты хромосом собаки объединяются в синтенные блоки, — говорит Ксения. — Это означает, что они произошли от схожих хромосом общего предка. И это может служить основой для выводов об их эволюционном процессе. Предыдущие исследования в области "мокрой" биологии показали, что геном кошек меньше изменился по сравнению с геномом их общего предка, чем геном собак. Это видно при сравнении с другими видами, не входящими в отряд хищных. Полученные нами результаты подтверждают эти выводы и делают их более точными. Это означает, что в некоторой конкретной части геном кошки и вида, взятого для сравнения, схож, а у собак он перестроен».
В будущем этот алгоритм будет использоваться в других исследованиях в области сравнительной геномики, которые проводятся в Университете ИТМО.
