Рост геномных баз данных влияет на точность идентификации видов
Быстрые методы секвенирования геномов привели к лавинообразному росту публичных баз данных, но этот рост происходит неравномерно: для одних видов бактерий данных очень много, для других — критически мало. Это выяснила группа исследователей под руководством специалиста по компьютерным наукам из Университета Райса Тодда Треангена.
Учёные протестировали методы таксономической классификации, которые сопоставляют геномные последовательности бактерий с записями в крупных базах данных для идентификации видов. В процессе они наметили пути повышения точности и чувствительности этих методов.
Исследование, опубликованное в журнале Genome Biology, показывает, как изменения с течением времени в широко используемой федеральной базе данных RefSeq (Национального центра биотехнологической информации, NCBI) повлияли на точность методов метагеномной классификации.
Ключевой проблемой для Треангена, эксперта в области метагеномики, является сохранение возможности быстро идентифицировать бактерии, представляющие угрозу для общественного здоровья. Низкая стоимость и высокая пропускная способность методов дробовидного секвенирования ДНК привели к тому, что объём геномных данных в RefSeq удваивается каждые 2–3 года.
«Изначально я думал, что больше данных — это всегда лучше для этих методов. Рост базы данных — это хорошо», — отметил Треанген. Однако исследователи обнаружили, что данные по бактериям в RefSeq оказывают непропорционально большое влияние на точность классификации на уровне вида в таксономической иерархии, который растёт стремительными темпами.
Это создаёт проблемы для исследователей, которые часто используют два распространённых метода:
- Классификация на основе k-меров — идентификация коротких последовательностей ДНК (длиной k) из образца по точным совпадениям с базой данных.
- Присвоение по методу наименьшего общего предка (LCA) — если точного совпадения нет, последовательность относят к более высокому таксономическому уровню (например, роду, а не виду).
Исследование показало, что инструмент Bracken, использующий байесовскую статистику для выбора наилучшего совпадения, помогает смягчить дисбаланс данных. Тем не менее, он испытывает трудности с идентификацией геномов, у которых в базе данных есть близкие, но не идеальные совпадения.
Треанген отметил, что хорошо финансируемые исследования конкретных патогенов (например, сальмонеллы) необходимы и помогают в быстром обнаружении вспышек, но в итоге смещают публичные базы данных в сторону определённых родов и семейств микробов. Это влияет на точность и чувствительность быстрых инструментов классификации, таких как Kraken.
Ярким примером ложноположительной идентификации стало исследование, которое изначально сообщило об обнаружении бактерий сибирской язвы в нью-йоркском метро. Последующий анализ показал, что это было неверное совпадение с Bacillus anthracis.
Для дальнейшего прогресса в этой области необходимы новые методы, способные справляться с ростом и «шумом» в базах данных, а также увеличение разнообразия секвенированных геномов. «Например, микроорганизмы из почвы и океана сильно недопредставлены», — заключил Треанген.
