Знаниевый движок готов ускорить геномные исследования

Пять лет назад команда специалистов по информатике, биомедицинских исследователей и биоинформатиков начала работу над проектом, призванным использовать силу коллективных знаний в геномных исследованиях. Их новая публикация в PLOS Biology представляет результат этих усилий — аналитическую платформу, которая помогает исследователям интерпретировать сложные геномные наборы данных.

Группа получила финансирование от Национальных институтов здравоохранения (NIH) для создания Центра передового опыта Big Data to Knowledge. Центр под руководством профессора информатики С. Синхи в Институте геномной биологии им. Карла Р. Воза (IGB) Университета Иллинойса в Урбане-Шампейне, в сотрудничестве с коллегами из Иллинойса и клиники Мэйо, создал первую в своем роде аналитическую платформу — Knowledge Engine for Genomics (KnowEnG). Соавторами публикации выступили Чарльз Блатти и Амин Эмад, бывшие постдоки центра.

Исходным результатом многих геномных исследований является набор генов интереса: генов с разным уровнем активности в разных условиях, несущих мутации, отличающие здоровые клетки от опухолевых, или демонстрирующих вариации у людей с разными состояниями здоровья.

Исследователям необходимо перевести такой список генов в комплексную интерпретацию. Распространенный подход — соотнести экспериментальные данные с существующими знаниями о биологической важности генов и их взаимосвязях. Однако у исследователя не было инструмента, подобного поисковой системе, чтобы легко объединять множество источников информации и применять их в разных типах анализа. Вместо этого каждый анализ выполнялся по частям, с переходом между разными инструментами. KnowEnG устраняет это препятствие.

Ключевые возможности KnowEnG:

  • Конвейерная обработка: Позволяет последовательно выполнять разные анализы, автоматически передавая результаты одного в качестве входных данных для следующего.
  • Обширная сеть знаний: Может объединять и синтезировать разнообразные источники существующей геномной информации в постоянно расширяющуюся "сеть знаний".
  • Широкий охват: Платформа позволяет пользователям загружать свои данные и настраивать пошаговый анализ для различных форм геномных данных человека или для данных любого из 19 модельных организмов.

Для демонстрации функциональности команда под руководством Блатти и Эмада повторно проанализировала ранее опубликованные данные в рамках платформы KnowEnG, получив новые выводы.

Платформа соответствует принципам FAIR (находимость, доступность, совместимость, удобство использования) и свободно доступна через веб-портал. Разработка велась с активным участием и обратной связью от биомедицинских исследователей из клиники Мэйо и Иллинойса на каждом этапе.

Хотя финансирование центра со стороны NIH завершилось, доступ к KnowEnG в этом году обеспечивает Онкологический центр Иллинойса. Дальнейшая разработка будет продолжена программой Healthcare Innovation в Национальном центре суперкомпьютерных приложений (NCSA), который поддерживает долгосрочную жизнеспособность программного обеспечения, созданного в Иллинойсе. Структура KnowEnG была разработана с учетом возможности добавления новых форм данных, аналитических процессов и стратегий визуализации в будущем.