Вычислительные инструменты помогут идентифицировать микробы в сложных образцах окружающей среды
Микроорганизмы, представляющие интерес для клиницистов и экологов, редко существуют изолированно. Организмы, необходимые для разложения загрязнителей или вызывающие заболевания, живут в сложных сообществах. Выделение одного микроба из сотен сопутствующих видов — сложная задача для исследователей.
Новый проект, поддержанный Национальным научным фондом (NSF), создаст вычислительные инструменты для идентификации и характеристики генетического разнообразия в таких микробных сообществах. Проект разрабатывается исследователями из Технологического института Джорджии и Университета штата Мичиган. Инструменты позволят сравнивать геномную информацию исследуемых организмов с растущими мировыми базами данных.
Инструменты будут размещены на веб-сервере, рассчитанном на исследователей без специальной подготовки в биоинформатике. Прототип системы с ограниченным набором инструментов уже доступен по адресу http://enve-omics.ce.gatech.edu и привлекает более 500 пользователей в месяц.
"Наша задача — идентифицировать организмы в смесях, для чего раньше не было хороших инструментов. Наши инструменты будут работать с геномами целых сообществ организмов", — пояснил руководитель проекта, профессор Костянтинос Константинидис.
Текущие методы идентифицируют отдельные микробы по генам малой субъединицы рибосомальной РНК (SSU rRNA). Новые инструменты позволят анализировать целые геномы и метагеномы, что даст лучшее понимание потенциала организма, например, способности кодировать токсины или ферменты для разложения загрязнителей.
Над трёхлетним проектом также работают учёные из Университета штата Мичиган, курирующие проект Ribosomal Database Project.
Идентификация организмов в сложных сообществах с помощью независимых от культивирования геномных технологий становится всё важнее, поскольку большинство микроорганизмов не растут в лабораторных условиях.
Группа Константинидиса изучает такие сообщества, например, в воде озёр системы реки Чаттахучи в Джорджии, анализируя их реакцию на такие воздействия, как разливы нефти или пестицидов.
"Эти инструменты родились из нашей исследовательской практики. Мы столкнулись с тем, что не могли обработать данные для ответа на наши вопросы", — отметил Константинидис.
Один литр воды из озера может содержать до 500 различных видов, а их общая геномная информация может составлять десятки миллиардов "букв" генетического кода. Только из озера Ланьер команда получила 200 гигабайт геномных данных.
Разрабатываемые инструменты будут полезны как клиническим микробиологам, так и экологам. Система будет включать удобные подсказки для учёных, не владеющих современными методами биоинформатики.
Одной из будущих задач является создание инфраструктуры, способной справиться с экспоненциально растущими объёмами геномных данных в мире.
Система будет первоначально работать на серверах в Технологическом институте Джорджии и Университете штата Мичиган. При росте спроса и объёмов данных могут быть задействованы дополнительные ресурсы, такие как суперкомпьютер XSEDE Национального научного фонда.
