Установление стандартных определений для геномных последовательностей

В 1996 году исследователи из крупнейших центров секвенирования геномов со всего мира собрались на острове Бермуды и определили завершённый геном как последовательность без пробелов с частотой ошибок на нуклеотид не более одной на 10 000 оснований. Этот "Бермудский стандарт" стал целевым показателем качества для проекта "Геном человека" и был быстро применён к другим геномным проектам. Если последовательность генома не соответствовала этому строгому критерию, она считалась просто "черновиком".

Спустя более десятилетие, с появлением новейших технологий секвенирования, исследователи пришли к выводу, что термины "черновик" и "завершённый" больше не достаточны для описания различных уровней качества производимых геномных последовательностей. Проблема качества особенно важна для любого исследователя, который хочет использовать последовательность, чтобы знать её целостность и надёжность. Это ещё более важно для референсных геномных последовательностей, например, тех, что создаются в рамках миссий Министерства энергетики США (DOE) по биоэнергетике и очистке окружающей среды, поскольку они дают фундаментальные знания о генном содержании и взаимодействии этих организмов с окружающей средой.

Поскольку поток данных превращается в "Ниагарский водопад" (консервативные оценки предсказывают появление 12 000 черновых геномов в публичных базах данных к 2012 году), исследователи могут быть удивлены, обнаружив, что эти наборы данных описывают неполные геномы.

Осознавая проблему, группа исследователей из нескольких центров секвенирования, включая DOE Joint Genome Institute (JGI), Институт Сэнгера и институты консорциума Human Microbiome Project (HMP) Jumpstart, предложила новый набор стандартов, расширяющих "Бермудский стандарт". В выпуске журнала Science от 9 октября они предлагают четыре дополнительные категории между статусами "черновик" и "завершённый", отражающие различные уровни полноты.

"В прошлом у нас было только два варианта, что заставляло нас и другие центры создавать внутренние определения", — сказал исследователь метагеномики DOE JGI в Лос-Аламосской национальной лаборатории (LANL) Патрик Чейн, первый автор статьи в Science. — "Но они неясны и не передаются в базы данных, куда мы отправляем последовательности. Поэтому, когда пользователи пытаются загрузить геномы, они получают данные неизвестного качества без информации или полный геном, который, как они предполагают, был проверен на ошибки пропущенных данных".

Чейн отметил, что когда он и другие организаторы конференции "Sequencing, Finishing, Analysis in the Future", проводимой LANL, впервые собрались в 2005 году, их беспокоило различное качество новых геномов, отправляемых в публичные архивы. Поскольку все организаторы представляли крупные центры секвенирования (а также более мелкие группы), в LANL была инициирована рабочая группа по стандартам геномных проектов.

Шесть категорий, определённых группой:

  1. "Стандартный черновик" — минимальный объём информации, необходимый для отправки в публичную базу данных.
  2. "Высококачественный черновик" — обычно генерируется крупными центрами секвенирования, такими как DOE JGI, и практически не подвергается ручной проверке.
  3. "Улучшенный высококачественный черновик" — данные, в некоторой степени проверенные людьми или машинами, так что большая часть генетических данных собрана правильно, но некоторые ошибки ещё могут присутствовать.
  4. "Улучшение, направленное аннотацией" — отсеквенированный сегмент, представляющий всю информацию в различных генных областях как можно более точно.
  5. "Несплошной завершённый" — последовательности, проверенные как людьми, так и машинами, которые считались бы завершёнными, за исключением "упрямых регионов", вызывающих проблемы.
  6. "Завершённый" — определяет полные последовательности с минимальными ошибками, если они вообще есть.

Крис Деттер из DOE JGI, один из старших авторов статьи и руководитель группы геномных наук LANL, заявил, что определения, приведённые в статье Science, довольно гибкие, поскольку группа хотела, чтобы предлагаемые стандарты применялись независимо от геномного проекта или используемых технологий секвенирования.

"Я надеюсь, что все крупные геномные центры и передовые геномные группы будут использовать градации, соответствующие их потребностям", — сказал он. — "Некоторые центры могут захотеть все шесть, в то время как некоторые — только три, но пока они сохраняют их в целости, всё в порядке. Затем я надеюсь, что более мелкие геномные группы примут классы как написано, чтобы помочь остальному научному сообществу понимать, что они генерируют и отправляют".

Чейн добавил, что процесс разработки предлагаемых стандартов был нелёгкой задачей, поскольку все крупные центры "имеют разные конвейеры обработки, разные методы секвенирования, разные внутренние стандарты". Они также признали, что попытка разработать "универсальный" набор стандартов всё ещё находится в процессе. Определения в статье Science довольно гибкие и предназначены для применения независимо от геномного проекта или используемых технологий секвенирования, чтобы соответствовать потребностям каждой группы.

"Мы ожидаем, что ряд людей прокомментирует эти стандарты и, возможно, расширит категории", — сказал он, — "но мы считаем, что охватили все основы этими шестью категориями".

Чейн сообщил, что группа планирует сотрудничать с Консорциумом по геномным стандартам (Genomic Standards Consortium) — движением, начатым учёными, обеспокоенными необходимостью стандартов сбора данных в геномных проектах. Группа также вела переговоры с публичными архивами, такими как GenBank, о добавлении этих предлагаемых стандартов к записям GenBank, чтобы исследователи могли понять, будут ли последовательности полезны для них.

"Стандарты — это серьёзная проблема, которую необходимо решить в геномике прямо сейчас", — сказал Чейн. — "Эти предложения — ориентиры, призванные информировать пользователей и создателей".

Источник: DOE/Joint Genome Institute

2009-10-08