Извлечение золота из потока данных
Новое поколение технологий секвенирования ДНК привело к накоплению огромных массивов данных, но используют ли исследователи их потенциал по максимуму? В новом исследовании, опубликованном в октябрьском выпуске журнала Applications in Plant Sciences, доктор Брент Бергер и его коллеги предлагают способ извлечь оставшуюся ценную информацию из больших наборов данных секвенирования. Авторы показывают, что новый метод интеллектуального анализа данных (data mining) можно использовать для получения ценной информации из уже существующих наборов данных, и доказывают эту концепцию, извлекая последовательности генов, влияющих на необычную структуру цветков у растений семейства Goodeniaceae.
Секвенирование ДНК стало настолько дешевым, что даже если исследователя интересует последовательность всего нескольких генов, часто проще отсеквенировать весь геном. Биоинформатические методы затем могут выделить нужные генные последовательности с меньшими трудозатратами, чем целевое секвенирование конкретных генов. Эта практика, известная как «skim sequencing» или «skim-секвенирование генома», становится все более популярным способом изучения родственных связей между видами растений.
Принцип skim-секвенирования заключается в использовании низкопокрытого дробового секвенирования (shotgun sequencing) для получения последовательностей ДНК из высококопийных фракций генома. При дробовом секвенировании геном разбивается на мелкие фрагменты, которые затем с помощью компьютера «сшиваются» обратно воедино, используя перекрывающиеся участки — этот процесс называется сборкой (assembly). Уровень «покрытия» (coverage) соответствует количеству секвенированных фрагментов; чем выше покрытие, тем проще собрать геном и получить более полную последовательность.
Однако высокое покрытие дороже, и на некоторые вопросы можно ответить с помощью более дешевого низкопокрытого секвенирования. «Высококопийные фракции» общей геномной ДНК, такие как геномы хлоропластов или ядерная рибосомальная ДНК, присутствуют в пуле последовательностей в большем количестве, поэтому могут быть полностью отсеквенированы даже при дешевом низкопокрытом анализе. Последовательности из этих фракций обычно используются для выяснения эволюционных взаимоотношений между видами. Но в процессе skim-секвенирования исследователи производят и затем отбрасывают огромное количество потенциально ценных данных. «Многие наборы данных skim-секвенирования используются для сборки генома хлоропласта, что в нашем случае задействовало только 3% секвенированных данных», — отметила соавтор исследования доктор Дианелла Хауарт.
В этом исследовании авторы повторно проанализировали набор данных skim-секвенирования, ранее использованный для изучения эволюции семейства Goodeniaceae (вересковые). Эти растения, известные как «веерные цветы» или «половинчатые цветы», имеют необычную форму цветка, похожую на разрезанный пополам. Авторы хотели выяснить, можно ли из этого набора данных получить больше информации о генетике, лежащей в основе уникальной структуры цветка. Они использовали несколько программных пакетов для сборки ранее неиспользованных фрагментов последовательностей из низкокопийной фракции исходных данных. Затем они провели поиск в полученной сборке последовательностей из набора генов CYCLOIDEA, которые участвуют в формировании структуры и симметрии цветка.
Авторам удалось получить достаточно фрагментов этих генов от нескольких видов, чтобы создать полные выравнивания (alignments) всех четырех генов CYCLOIDEA у представителей ядра семейства Goodeniaceae. Эти данные могут оказаться полезными для будущих исследований эволюции причудливой структуры цветка в этой группе. «Сравнение последовательностей генов, подобных CYCLOIDEA, в этой кладе может дать ключи к пониманию конкретных изменений в последовательности, которые приводят к изменениям в морфологии цветка», — пояснила доктор Хауарт.
В более широком смысле, добавила доктор Хауарт, «фрагменты любого интересующего гена потенциально можно извлечь из уже существующих наборов данных skim-секвенирования». Фрагмент гена может показаться незначительным, но у таких фрагментов есть удивительно много применений. «Эти данные могут предоставить достаточно информации для определения полезных ядерных регионов для филогенетического анализа или для выявления возможных событий дупликации генов. Кроме того, на их основе можно быстро создать зонды для целевого обогащения (target enrichment sequencing) по всей кладе, чтобы изучить гены-кандидаты и их регуляторные регионы в исследованиях эво-дево (evo-devo)».
Подобные подходы интеллектуального анализа данных позволяют гораздо полнее использовать наборы данных skim-секвенирования. Это дает возможность отвечать на важные вопросы с помощью уже существующих данных и открывает двери для ученых, у которых нет доступа к ресурсам для создания крупномасштабных наборов данных — например, для ученых из небольших колледжей или стран без крупных грантодающих организаций. Поскольку потоки данных секвенирования ДНК продолжают нарастать, такие исследования указывают пути, которые помогут не упустить ценную информацию.
