Целый ботанический сад геномов
Статья, опубликованная в открытом журнале GigaScience, предоставляет данные, которые фактически утраивают количество видов растений с доступными геномными данными. Эта колоссальная работа является частью растущих усилий научного сообщества по секвенированию большего числа геномов растений для понимания их сложной эволюции и получения практической информации для повышения урожайности в сельском хозяйстве. На сегодня секвенировано около 350 геномов наземных растений. Стремление к увеличению числа секвенированных геномов растений недавно было подчеркнуто анонсом проекта 10KP, целью которого является секвенирование 10 000 геномов растений для разрешения эволюции всех основных ветвей древа жизни растений. Данная работа предоставляет изображения, данные сырого секвенирования, собранные геномы хлоропластов и предварительные сборки ядерных геномов — всё в свободном доступе. По сути, эта работа является цифровым представлением целого ботанического сада.
Исследователи из China National GeneBank, BGI и Forestry Bureau of Ruili отобрали и секвенировали 761 образец, представляющий 689 видов сосудистых растений из 137 семейств и 49 порядков. Все образцы растений собраны в окрестностях 500-гектарного Ботанического сада в Руили, субтропическом районе Китая на границе с Мьянмой. Находясь в биологически богатом регионе, сад занимается защитой исчезающих и эндемичных для Китая растений, включая сохранение и архивирование их гермоплазменных ресурсов. Этот проект — первая в мире научная и систематическая попытка оцифровать целый ботанический сад на основе геномной информации и данных гербарных образцов.
Генеральный директор BGI и соавтор статьи Сюнь Сюй отмечает научный потенциал этого ресурса: «Текущее понимание эволюции растений и их разнообразия в филогеномном контексте ограничено из-за отсутствия геномной информации по филогенетически разнообразным видам. Этот инновационный проект интегрирует новый подход к оцифровке всех видов растений для расширения эволюционных и экологических исследований в ботанических садах».
В общей сложности исследователи произвели 54 терабайта данных секвенирования со средней глубиной покрытия 60X на вид. Помимо базовой задачи проведения ДНК-секвенирования такого количества видов, другой серьёзной задачей стало масштабирование идентификации видов, оцифровка изображений образцов и создание нового гербария для их хранения в новом гербарии China National GeneBank (CNGB) в Шэньчжэне. На данный момент, для 761 образца данные секвенирования и хлоропластов позволили идентифицировать 257 растений на уровне вида и 504 — на уровне семейства. Методы глубокого обучения также успешно применены для 181 вида, позволив идентифицировать их до уровня вида.
Соавтор Тин Ян говорит, что это был «самый большой объём данных, который я когда-либо обрабатывал. Самыми большими проблемами во время анализа данных были проверка последовательностей и изучение результатов». Это потребовало от исследователей индивидуальной проверки данных секвенирования каждого из 761 образца и сравнения последовательностей генов хлоропластов с гербарными образцами для идентификации видов.
Другой сложностью, связанной с подготовкой к секвенированию, был сбор всех образцов. Соавтор Цзиньпу Вэй заявляет: «Мы сотрудничали с экспертами из Лесного бюро Руили для сбора растительных материалов, распространённых в районе Руили, с целью создания цифрового ботанического сада. После 45 дней утомительной работы мы собрали 1093 растительных материала. Хотя транспортировка материалов была для нас сложной задачей, в итоге нам удалось обеспечить их высокое качество для будущих исследований».
Автор-корреспондент Синь Лю добавляет, что проект «был базовым для тонкой настройки и стандартизации отбора проб, методологий, а также техник накопления и анализа данных для крупномасштабных геномных проектов, таких как 10KP (10 thousand Plant Genome Project). В рамках этого проекта мы получили значительный и полезный опыт для последующего сбора образцов, секвенирования и сборки. В то же время данные, полученные в этом исследовании, могут быть эффективно использованы в последующих геномных проектах».
Несмотря на построение только одной библиотеки секвенирования для каждого вида, авторам удалось собрать предварительные геномы для 17 из них, что отражает качество и потенциал повторного использования ДНК. Исследователи из Китайского университета Гонконга уже независимо собрали геномы видов, представляющих для них особый интерес. Потенциал для более широкого научного сообщества в изучении интересующих видов, улучшении других геномов, разработке инструментов и методов, а также предоставлении образовательных возможностей для новых поколений учёных огромен.
Ведущий автор Хуань Лю добавил: «Геномная характеристика предоставит большой объём базовых данных для сборки геномов растений, что станет отличным стартом для проекта 10KP. В то же время это закладывает хорошую основу для будущих исследований корреляционного механизма от макроскопической экологии и биоразнообразия до микроскопического молекулярного уровня».
Для содействия более широкому обмену данными, помимо предоставления доступа к последовательностям, исследователи также делают доступными оцифрованные изображения и обеспечивают доступ к гербарию. Гербарий (HCNGB) служит живой базой данных растений, которая фиксирует положение видов, выращиваемых в Ботаническом саду Руили, и отслеживает статус каждого вида.
Все цифровые данные, полученные в ходе работы (изображения, данные сырого секвенирования, собранные геномы хлоропластов и предварительные сборки ядерных геномов), доступны через NCBI SRA, базу данных GigaScience GigaDB и China National GeneBank CNSA. Кроме того, чтобы данные можно было искать, а идентификацию геномов и видов — обновлять, метаданные индексируются и связываются через Datacite и GigaDB. Все ресурсы выпущены без ограничений под отказом от прав CC0. Автор доктор Сунил Кумар Саху подчеркнул, что это самое важное наследие проекта: «Этот набор данных представляет большую ценность для исследователей растений и, что более важно, может служить ориентиром для будущих проектов планетарного масштаба по секвенированию геномов, включая Earth BioGenome Project (EBP) и 10 thousand Plant Genome Project (10KP)».
