Программное обеспечение находит гены сахарного тростника, представляющие интерес

Растения имеют более крупные и сложные геномы, чем все животные. Геном человека состоит из примерно 3,2 миллиарда пар оснований на 46 хромосомах. Геном пшеницы (Triticum aestivum) содержит 17 миллиардов пар оснований на 42 хромосомах. Геном сахарного тростника (Saccharum spp.) включает 10 миллиардов пар оснований в 100-130 хромосомах.

Современный сахарный тростник — это гибрид (S. hybridum), полученный от скрещивания видов S. officinarum и S. spontaneum.

"Геном сахарного тростника стал гигантским. С ним очень трудно работать с помощью современных геномных методов. Для его расшифровки требуется огромная вычислительная мощность", — сказал Марсело Фалсарелла Каразолле, координатор по биоинформатике в Лаборатории геномики и биоэнергетики (LGE) Университета Кампинаса (Бразилия).

Консорциум исследователей недавно впервые успешно секвенировал весь геном сахарного тростника, используя стратегию, требующую масштабных вычислений и больших инвестиций.

Альтернативная стратегия

В статье в журнале DNA Research Каразолле и коллеги представляют другую, менее затратную и трудоемкую стратегию, предназначенную для картирования конкретных участков геномов полиплоидных растений.

"Мы не пытались собрать весь геном. Наша стратегия заключалась в том, чтобы сосредоточиться на небольших участках, соответствующих примерно 1%-2%, именно там, где находятся гены, представляющие интерес для селекционеров растений", — объяснил Каразолле.

Эта стратегия сэкономила как минимум два порядка величины по сравнению с десятками миллионов долларов, необходимых для картирования всего генома. Исследователи использовали общедоступные данные (геномы сорго, риса и кукурузы) для поиска аналогичных областей в геноме сахарного тростника, поскольку все злаки имеют общего предка, существовавшего более 50 миллионов лет назад.

Polyploid Gene Assembler (PGA)

Результатом исследования стал программный пакет Polyploid Gene Assembler (PGA).

"PGA представляет собой новую стратегию сборки генетического пространства на основе сложных геномов с использованием низкопокрытого секвенирования ДНК", — сказал Каразолле.

Для работы программы потребовались высокопроизводительные компьютеры Центра вычислительной техники в инженерии и науке (CCES). Исследователи:

  • Загрузили в PGA известные локусы генов из публичных баз данных.
  • Протестировали процедуру на пшенице (гексаплоидный вид), используя ячмень (Hordeum vulgare) в качестве референса.
  • Идентифицировали более 90% генов, а также несколько новых генов.

Кроме того, они использовали PGA для сборки генов вида S. spontaneum.

"Мы идентифицировали в общей сложности 39 234 гена, 60,4% из которых были сгруппированы в известные семейства генов злаков. Три семейства выделялись количеством копий генов, потенциально вовлеченных в начальное развитие и реакцию на стресс".

Результаты для генома S. spontaneum впервые выявили молекулярную основу таких важных характеристик, как высокая продуктивность и устойчивость к биотическому и абиотическому стрессу.

"Используя PGA, мы предоставили высококачественную сборку генных регионов у T. aestivum и S. spontaneum, доказав, что PGA может быть более эффективной, чем обычные стратегии, применяемые к сложным геномам. Низкие требования PGA к памяти по сравнению с обычной стратегией сборки также являются преимуществом".

2019-05-15