Пять простых правил для контроля качества новых последовательностей ДНК
Как и любой источник информации, последовательности ДНК имеют разную степень качества и надежности. Проверка, подтверждение подлинности и отбраковка скомпрометированных молекулярных данных стали критически важной частью научной работы. Предполагается, что каждый, кто генерирует такие данные, проводит эту проверку перед их использованием в исследованиях.
Однако, как отмечает доктор Хенрик Нильссон из Гётеборгского университета, ведущий автор новой статьи в журнале MycoKeys, многие исследователи находят контроль качества последовательностей сложным. Не существует простого и понятного руководства, которое дало бы им хороший старт. В результате ученые по-разному осознают необходимость такого контроля и применяют разные методы. Предыдущие исследования выявили существенные недостатки в публично доступных последовательностях ДНК — например, более 10% грибных последовательностей могут быть ошибочно идентифицированы на уровне вида.
Соавтор статьи, профессор Урмас Кольяльг из Тартуского университета, добавляет, что доступное программное обеспечение для контроля качества часто очень сложное и ресурсоемкое. Несправедливо ожидать, что каждый будет иметь к нему доступ и в совершенстве им владеть. К счастью, многое можно сделать вручную с помощью обычного веб-браузера. Статья в MycoKeys как раз описывает эти методы, чтобы помочь биологам без сильной компьютерной подготовки.
Статья «Five simple guidelines for establishing basic authenticity and reliability of newly generated fungal ITS sequences» обобщает принципы и наблюдения, помогающие читателю в управлении качеством последовательностей. Хотя фокус сделан на грибах и гене ITS, руководства носят общий характер и применимы к большинству групп организмов и генов. Они ориентированы на традиционное секвенирование ДНК и широко применимы для наборов данных в систематике, таксономии и экологии.
Как заключает соавтор доктор Мартин Хартманн из Швейцарского федерального исследовательского института WSL, цель руководств — помочь исследователям улучшить свои наборы данных. Это необходимо, чтобы в конечном итоге остановить тенденцию роста «шума» в публичных базах данных последовательностей. Молекулярные данные несут в себе огромный потенциал, и нельзя позволить, чтобы их точность страдала из-за систематических ошибок и артефактов.
