Рост геномных баз данных влияет на точность идентификации видов

Быстрые методы секвенирования геномов привели к лавинообразному росту публичных баз данных, но этот рост происходит неравномерно: для одних видов бактерий данных очень много, для других — критически мало. Это выяснила группа исследователей под руководством специалиста по компьютерным наукам из Университета Райса Тодда Треангена.

Учёные протестировали методы таксономической классификации, которые сопоставляют геномные последовательности бактерий с записями в крупных базах данных для идентификации видов. В процессе они наметили пути повышения точности и чувствительности этих методов.

Исследование, опубликованное в журнале Genome Biology, показывает, как изменения с течением времени в широко используемой федеральной базе данных RefSeq (Национального центра биотехнологической информации, NCBI) повлияли на точность методов метагеномной классификации.

Ключевой проблемой для Треангена, эксперта в области метагеномики, является сохранение возможности быстро идентифицировать бактерии, представляющие угрозу для общественного здоровья. Низкая стоимость и высокая пропускная способность методов дробовидного секвенирования ДНК привели к тому, что объём геномных данных в RefSeq удваивается каждые 2–3 года.

«Изначально я думал, что больше данных — это всегда лучше для этих методов. Рост базы данных — это хорошо», — отметил Треанген. Однако исследователи обнаружили, что данные по бактериям в RefSeq оказывают непропорционально большое влияние на точность классификации на уровне вида в таксономической иерархии, который растёт стремительными темпами.

Это создаёт проблемы для исследователей, которые часто используют два распространённых метода:

  1. Классификация на основе k-меров — идентификация коротких последовательностей ДНК (длиной k) из образца по точным совпадениям с базой данных.
  2. Присвоение по методу наименьшего общего предка (LCA) — если точного совпадения нет, последовательность относят к более высокому таксономическому уровню (например, роду, а не виду).

Исследование показало, что инструмент Bracken, использующий байесовскую статистику для выбора наилучшего совпадения, помогает смягчить дисбаланс данных. Тем не менее, он испытывает трудности с идентификацией геномов, у которых в базе данных есть близкие, но не идеальные совпадения.

Треанген отметил, что хорошо финансируемые исследования конкретных патогенов (например, сальмонеллы) необходимы и помогают в быстром обнаружении вспышек, но в итоге смещают публичные базы данных в сторону определённых родов и семейств микробов. Это влияет на точность и чувствительность быстрых инструментов классификации, таких как Kraken.

Ярким примером ложноположительной идентификации стало исследование, которое изначально сообщило об обнаружении бактерий сибирской язвы в нью-йоркском метро. Последующий анализ показал, что это было неверное совпадение с Bacillus anthracis.

Для дальнейшего прогресса в этой области необходимы новые методы, способные справляться с ростом и «шумом» в базах данных, а также увеличение разнообразия секвенированных геномов. «Например, микроорганизмы из почвы и океана сильно недопредставлены», — заключил Треанген.

2018-10-30