Нейросеть-«оракул» для предсказания эволюции регуляции генов
Только 1% человеческого генома — это кодирующие ДНК-последовательности, несущие инструкции для сборки белков. Остальные 99% — некодирующая ДНК, которая регулирует активность генов, включая и выключая их. Мутации в этих регуляторных областях могут влиять на экспрессию генов и иногда связаны с риском заболеваний, от диабета 2-го типа до рака.
Чтобы понять последствия таких мутаций, ученые создают математические модели — «ландшафты приспособленности», которые связывают генетическую последовательность с экспрессией генов и их влиянием на организм. Однако для анализа и визуализации сложных современных данных нужны новые инструменты.
В новом исследовании, опубликованном 9 марта в Nature, ученые разработали фреймворк для изучения ландшафтов приспособленности регуляторной ДНК. Они создали модель на основе нейронной сети, которую обучили на сотнях миллионов экспериментальных измерений. Модель способна предсказывать, как изменения в некодирующих последовательностях дрожжей влияют на экспрессию генов. Также исследователи разработали уникальный способ визуализации этих ландшафтов в двух измерениях, что упрощает понимание прошлой и прогнозирование будущей эволюции некодирующих последовательностей не только у дрожжей. Этот подход открывает возможности для проектирования заданных паттернов экспрессии генов для генной терапии и промышленных применений.
«Теперь у нас есть "оракул", к которому можно обратиться с вопросом: что, если мы попробуем все возможные мутации этой последовательности? Или: какую новую последовательность нам следует спроектировать, чтобы получить желаемую экспрессию?» — говорит Авив Регев, старший автор исследования.
В отличие от предыдущих работ, где модели обучали на известных природных мутациях, команда Регев создала модель, способную предсказывать приспособленность и экспрессию генов на основе любой возможной ДНК-последовательности, даже никогда ранее не встречавшейся. Для обучения модели использовали данные эксперимента, в котором в дрожжи вставляли миллионы случайных некодирующих последовательностей (промоторов) и наблюдали за их влиянием на экспрессию.
«Эта работа показывает, какие возможности открываются, когда мы разрабатываем новые виды экспериментов для получения правильных данных для обучения моделей», — отмечает Регев.
Модель протестировали разными способами:
- Для задач синтетической биологии (производство антибиотиков, ферментов) её использовали для дизайна промоторов, дающих нужный уровень экспрессии любого гена.
- На основе данных о популяциях дрожжей со всего мира модель смогла реконструировать тысячи лет эволюционного давления, сформировавшего современные геномы.
- Чтобы сделать инструмент универсальным, исследователи разработали вычислительный метод для визуализации предсказаний модели в виде двумерного графика. Это позволяет просто оценить влияние любой некодирующей последовательности на экспрессию и приспособленность без трудоемких лабораторных экспериментов.
Мартин Тейлор, профессор генетики, не участвовавший в исследовании, отмечает, что работа демонстрирует, как искусственный интеллект может не только предсказывать эффект изменений в регуляторной ДНК, но и раскрывать принципы, управляющие миллионами лет эволюции.
«Есть очевидные краткосрочные применения, такие как индивидуальный дизайн регуляторной ДНК для дрожжей в пивоварении, хлебопечении и биотехнологии. Но развитие этой работы может также помочь выявлять болезнетворные мутации в регуляторной ДНК человека, которые сейчас трудно найти и которые в основном упускаются из виду в клинике», — говорит Тейлор.
Даже до публикации работы авторы начали получать запросы от исследователей, желающих использовать модель для создания некодирующих последовательностей для генной терапии.
