Стандарты для новой геномной эры
Генетики из Лос-Аламосской национальной лаборатории вместе с консорциумом международных исследователей предложили набор стандартов для оценки качества общедоступных данных генетического секвенирования. Новые стандарты могут позволить исследователям эффективнее разрабатывать вакцины или помочь службам общественного здравоохранения быстрее реагировать на чрезвычайные ситуации.
В недавнем выпуске журнала Science генетик Патрик Чейн и коллеги представили шесть меток для данных о последовательности генома вместо двух, используемых сегодня. Эти метки будут характеризовать полноту и точность данных, а следовательно, и их потенциальную надежность. Это крайне важно, поскольку исследователи ежедневно используют такие данные для сравнения неизвестного генетического материала с генетическим материалом известных организмов.
Каждый живой организм с ДНК имеет хромосомы, содержащие четыре молекулярных строительных блока, или пары оснований, представленных буквами A, T, G и C. Одна хромосома может содержать миллионы пар оснований. Эти пары организованы в специфические последовательности, составляющие гены, которые несут генетические инструкции.
Исследователи каталогизировали генетические данные тысяч организмов и разместили их в общедоступных библиотеках. Эти библиотеки используются для перекрестной проверки данных, например, при попытке изолировать неизвестную угрозу для здоровья или определить местоположение гена на хромосоме. В таких областях, как исследование биотоплива или восстановление окружающей среды, генетические данные могут помочь определить, способны ли микроорганизмы эффективно расщеплять растительную биомассу для производства этанола или переваривать загрязнители, такие как углеводороды.
Однако из-за сложности генетических данных информация в публичных библиотеках может варьироваться от очень грубой до очень точной. Раньше генетические данные классифицировались либо как «черновые» (draft), либо как «завершенные» (finished), что оставляло большую неопределенность в их потенциальной точности.
«За последние несколько лет мы стали свидетелями значительного прогресса в технологии генетического секвенирования, поэтому мы наблюдаем взрывной рост объема общедоступных данных, — сказал Чейн, ведущий автор статьи в Science. — Объем данных о последовательностях пар оснований, генерируемых каждый день, исчисляется миллиардами — на порядки больше, чем несколько лет назад. Разные технологии секвенирования имеют разный уровень точности. Высокая степень неопределенности в последовательности может потенциально направить исследователя по ложному пути, по которому он мог бы следовать год или больше. Теперь нам нужны стандарты, которые предоставят исследователям однозначную оценку качества данных генетической последовательности».
Работая с исследователями из крупных и малых центров секвенирования генома, включая Объединенный институт генома Министерства энергетики США, Институт Сэнгера, центры секвенирования Консорциума Human Microbiome Project Jumpstart, Университет штата Мичиган и Онтарийский институт исследований рака, Чейн и коллеги предложили распределять данные последовательности по одной из шести категорий, которые дополняют существующие две. Шесть стандартов варьируются от «стандартной черновой последовательности» (standard draft sequence), представляющей минимальные требования для публичной подачи, до «завершенной последовательности» (finished sequence), высшего стандарта, который можно проверить на наличие только одной ошибки секвенирования на 100 000 пар оснований.
«Я надеюсь, что все крупные геномные центры и передовые группы геномики будут использовать градации, соответствующие их потребностям, — сказал Крис Деттер, руководитель группы геномных наук LANL и директор Центра Объединенного института генома–LANL. — Некоторые центры могут захотеть все шесть, в то время как некоторые могут захотеть только три, но пока они сохраняют их в целости, мы в хорошей форме. Затем я надеюсь, что небольшие группы геномики примут классы в том виде, в каком они написаны, чтобы помочь остальному научному сообществу знать, что они генерируют и представляют».
Источник: Los Alamos National Laboratory
