Автоматизация очистки геномных последовательностей микроорганизмов от загрязнений
Исследователи из Прокариотической суперпрограммы Объединенного института генома Министерства энергетики США (DOE JGI) разработали первый вычислительный протокол для быстрого и автоматического удаления загрязняющих последовательностей из черновых геномов. Инструмент под названием ProDeGe (Protocol for Decontamination of Genomes) описан в исследовании, опубликованном 9 июня 2015 года в The ISME Journal.
Как работает ProDeGe
- Инструмент классифицирует последовательности как «чистые» или «загрязняющие».
- Он работает со скоростью 0.30 CPU core часов на мегабазу последовательности. Для сравнения, эксперту вручную требуется около шести часов для очистки 1 мегабазы. Таким образом, ProDeGe ускоряет процесс примерно в 20 раз.
- Инструмент предварительно откалиброван на удаление не менее 84% загрязняющей последовательности.
- ProDeGe лучше всего работает, когда может сравнить тестируемую последовательность с гомологами в базе данных на уровне Класса или глубже. Для последовательностей от новых организмов он удаляет загрязнения, анализируя только состав последовательности.
Значение для науки
ProDeGe решает критическую проблему масштабирования в таких областях, как:
Геномика единичных клеток (Single cell genomics)
Метагеномика (Metagenomics)
Эти методы являются основными источниками информации о биологии некультивируемых микроорганизмов, которые преобладают в большинстве экосистем. Риск загрязнения ДНК — серьезная проблема для данных, полученных этими методами.
Ключевые преимущества инструмента:
- Автоматизация: Освобождает ученых от часов ручной проверки.
- Контроль качества: Предотвращает попадание загрязненных данных в публичные базы (GenBank, PDB), что могло бы вести к ошибочным анализам.
- Высокая пропускная способность: Впервые позволяет проводить высокопроизводительную очистку наборов данных.
ProDeGe доступен через веб-интерфейс (http://prodege.jgi-psf.org) или как автономное программное обеспечение для систем с Perl, R и NCBI BLAST.
