Предсказание реакции генов грибов с помощью нового подхода машинного обучения

Традиционно сложно изучать, как сигналы среды влияют на организм, так как они запускают каскад изменений, по-разному затрагивающих гены. В новом исследовании учёные разработали подход машинного обучения FUN-PROSE для предсказания реакции генов на различные условия среды.

Клетки регулируют реакцию на окружающую среду с помощью mRNA. Белки-транскрипционные факторы связываются с промоторной последовательностью ДНК перед геном, что может либо останавливать, либо усиливать образование mRNA. Затем mRNA служит шаблоном для производства белков, что позволяет клетке быстро перераспределять ресурсы.

Изучение регуляции промоторов — давняя проблема в геномике, поскольку разные транскрипционные факторы могут связываться с одним промотором в различных комбинациях в зависимости от условий. Хотя известно, что факторы связываются с определёнными мотивами в промоторах, не все они хорошо изучены.

«Предыдущие модели машинного обучения не могли измерить, как уровни экспрессии генов меняются в разных условиях», — отметил профессор Сергей Маслов. Учёных интересовала реакция на изменения pH, температуры и питательных веществ.

Они разработали модель FUN-PROSE (FUNgal PRomoter to cOndition-Specific Expression) для предсказания реакции пекарских дрожжей (Saccharomyces cerevisiae) и менее изученных грибов Neurospora crassa и Issatchenkia orientalis.

Для создания модели сначала идентифицировали промоторные последовательности и транскрипционные факторы для трёх видов. Модель обучили распознавать, какие мотивы в промоторах связываются факторами в разных условиях. Для N. crassa и I. orientalis, чьи факторы изучены хуже, пришлось выявлять гены-мишени, сканируя участки белков, связывающиеся с ДНК.

Затем модель научили интегрировать информацию, чтобы вычислять, сколько mRNA производится в конкретном условии по сравнению со средним уровнем. Результаты FUN-PROSE сравнили с данными RNA-seq, измеряющими уровни mRNA у всех трёх грибов. Каждый организм имеет более 4000 генов и 180 транскрипционных факторов, измеренных в 12–295 условиях.

«Мы обнаружили, что наша модель была очень близка к предсказанию того, что на самом деле происходит в этих организмах», — сказал аспирант Анатан Намбиар.

Исследователи также выяснили, как модель делает предсказания. «Мы смогли понять, как наша модель анализирует промоторы, и увидели, что она научилась искать известные последовательности», — отметил Саймон Лю. Возможность интерпретировать модель важна для проверки её логики и открытия новых регуляторных знаний.

Однако модель испытывает трудности с промоторами, которые раньше не встречала. «Модель отлично справляется с новыми условиями, но если дать ей новый ген или последовательность промотора, она ошибается», — пояснил Намбиар.

По словам Маслова, ошибки связаны с ограниченным объёмом данных. «Если мы сможем получить больше данных, у модели будет больше шаблонов для обучения и более точные предсказания».

Теперь учёные хотят протестировать модель на других организмах. «В принципе, для нашей техники нет ограничений — она должна работать на любом организме. Однако у животных, например, гены контролируются более сложными способами, что потребует значительных изменений в архитектуре модели и гораздо больше обучающих данных», — сказал Маслов.

Исследование опубликовано в журнале PLOS Computational Biology.

2023-11-20