Объяснимый ИИ для расшифровки биологии генома

Исследователи из Института медицинских исследований Стоуэрс совместно с коллегами из Стэнфордского университета и Технического университета Мюнхена разработали передовой объяснимый искусственный интеллект (ИИ) для расшифровки регуляторных инструкций, закодированных в ДНК. В статье, опубликованной 18 февраля 2021 года в Nature Genetics, команда показала, что нейронная сеть, обученная на высокоразрешенных картах взаимодействий белок-ДНК, может выявлять тонкие паттерны последовательности ДНК по всему геному и обеспечивать более глубокое понимание того, как эти последовательности организованы для регуляции генов.

Нейронные сети — это мощные модели ИИ, способные обучаться сложным паттернам на разнообразных данных (изображения, речь, текст) и с высокой точностью предсказывать связанные свойства. Однако их часто считают неинтерпретируемыми, поскольку извлечь выученные паттерны из модели сложно. Эта природа «чёрного ящика» мешала широкому применению нейронных сетей в биологии, где интерпретация предсказательных паттернов крайне важна.

Одна из больших нерешённых проблем в биологии — второй код генома, его регуляторный код. Основания ДНК (A, C, G, T) кодируют не только инструкции по сборке белков, но и то, когда и где эти белки производить в организме. Регуляторный код считывается белками — транскрипционными факторами, которые связываются с короткими участками ДНК, называемыми мотивами. Однако то, как конкретные комбинации и расположение мотивов определяют регуляторную активность, — чрезвычайно сложная проблема.

Междисциплинарная команда биологов и вычислительных исследователей под руководством Джулии Цайтлингер (Институт Стоуэрс) и Аншула Кундаже (Стэнфорд) разработала интерпретируемую нейронную сеть — BPNet (Base Pair Network). Она предсказывает связывание транскрипционных факторов с ДНК с беспрецедентной точностью, что позволяет раскрыть регуляторный код. Ключевым было проведение экспериментов по связыванию и вычислительному моделированию с максимально возможным разрешением — на уровне отдельных пар оснований ДНК. Это позволило разработать новые инструменты интерпретации для извлечения ключевых паттернов последовательности (мотивов связывания) и комбинаторных правил, по которым мотивы функционируют вместе как регуляторный код.

«Это было чрезвычайно удовлетворительно, — говорит Цайтлингер, — поскольку результаты прекрасно согласовывались с существующими экспериментальными данными, а также раскрыли новые неожиданные детали».

Например, модели нейронной сети позволили обнаружить поразительное правило, управляющее связыванием хорошо изученного транскрипционного фактора Nanog. Оказалось, что Nanog кооперативно связывается с ДНК, когда множественные копии его мотива присутствуют в периодической манере, так что они оказываются на одной стороне спирали ДНК.

«Существовала длинная череда экспериментальных свидетельств, что такая периодичность мотивов иногда существует в регуляторном коде, — говорит Цайтлингер. — Однако точные обстоятельства были неуловимы, и Nanog не был под подозрением. Обнаружить, что у Nanog есть такой паттерн, и увидеть дополнительные детали его взаимодействий, было удивительно, потому что мы не искали этот паттерн специально».

«В этом ключевое преимущество использования нейронных сетей для этой задачи, — говорит Жига Авсец, первый автор статьи. — Более традиционные биоинформатические подходы моделируют данные, используя предопределённые жёсткие правила, основанные на существующих знаниях. Однако биология чрезвычайно богата и сложна. Используя нейронные сети, мы можем обучать гораздо более гибкие и детальные модели, которые учатся сложным паттернам с нуля, без предварительных знаний, что позволяет делать новые открытия».

Архитектура сети BPNet похожа на архитектуру сетей, используемых для распознавания лиц на изображениях. Только вместо пикселей BPNet обучается на сырой последовательности ДНК: сначала обнаруживает мотивы последовательности, а в итоге изучает правила более высокого порядка, по которым эти элементы предсказывают данные о связывании с парным разрешением.

После обучения высокоточная модель используется как «оракул»: её систематически опрашивают определёнными дизайнами последовательностей ДНК (аналогично экспериментальной проверке гипотез), чтобы раскрыть правила комбинаторного функционирования мотивов.

«Красота в том, что модель может предсказать гораздо больше вариантов последовательностей, чем мы можем проверить экспериментально, — говорит Цайтлингер. — Более того, предсказывая исход экспериментальных пертурбаций, мы можем определить наиболее информативные эксперименты для валидации модели».

Действительно, с помощью методов генного редактирования CRISPR исследователи подтвердили, что предсказания модели были высокоточными.

Поскольку подход гибок и применим к различным типам данных и клеток, он обещает привести к быстро растущему пониманию регуляторного кода и того, как генетические вариации влияют на регуляцию генов. Лаборатории Цайтлингер и Кундаже уже используют BPNet для надёжной идентификации мотивов связывания в других типах клеток, связи мотивов с биофизическими параметрами и изучения других структурных особенностей генома (например, связанных с упаковкой ДНК).

Чтобы другие учёные могли использовать BPNet и адаптировать его под свои нужды, исследователи сделали весь программный фреймворк доступным вместе с документацией и руководствами.

2021-02-18