Глубокое обучение позволяет идентифицировать и оптимизировать РНК-инструменты для множества применений

Две научные группы из Института Висса при Гарвардском университете и Массачусетского технологического института разработали алгоритмы машинного обучения, способные анализировать множество последовательностей РНК-"тухолдов" (toehold switches) и предсказывать, какие из них будут наиболее эффективны для обнаружения и реакции на заданную последовательность-мишень. Результаты, опубликованные в двух статьях в Nature Communications, могут быть обобщены на другие задачи синтетической биологии и ускорить разработку биотехнологических инструментов.

Анализ "тухолд свитчей"

В качестве испытательной платформы исследователи выбрали класс искусственных молекул РНК — "тухолд свитчи". В "выключенном" состоянии они свернуты в шпилечную структуру. При связывании комплементарной цепи РНК с "триггерной" последовательностью свитч разворачивается ("включается"), позволяя рибосомам транслировать нижележащий ген в белок. Это обеспечивает точный контроль экспрессии генов в ответ на присутствие целевой молекулы.

Однако многие спроектированные по известным правилам сворачивания РНК тухолд свитчи плохо работают в эксперименте. Для решения этой проблемы команды решили использовать машинное обучение для анализа большого объема последовательностей и точного предсказания их качества.

Первой задачей стало создание достаточно большого набора данных. Исследователи сгенерировали библиотеку почти из 100 000 тухолд свитчей, систематически отбирая короткие триггерные регионы из геномов 23 вирусов и 906 человеческих транскрипционных факторов.

Традиционные методы анализа (механистическое моделирование на основе термодинамики и физических свойств) не смогли с достаточной точностью предсказать, какие тухолды работают лучше.

Картинка стоит тысячи пар оснований

Авторы первой статьи решили анализировать тухолд свитчи не как последовательности оснований, а как двумерные "изображения" возможных вариантов спаривания оснований. Они обучили алгоритм компьютерного зрения на этих "картинках", чтобы он распознавал тонкие паттерны, указывающие на качество свитча.

Для интерпретации результатов команда разработала подход VIS4Map (Visualizing Secondary Structure Saliency Maps), который позволил "увидеть", на какие части последовательности алгоритм "обращал внимание" при классификации. VIS4Map успешно выявил физические элементы, влияющие на работу свитчей, и показал, что тухолды с большим количеством потенциально конкурирующих внутренних структур более "протекающие" и менее качественные.

Говоря на одном языке

Вторая команда создала две разные архитектуры глубокого обучения. Они не только предсказывали качество, но и оптимизировали плохо работающие тухолд свитчи.

  1. Модель на основе сверточной нейронной сети (CNN) и многослойного перцептрона (MLP) рассматривает последовательности как одномерные изображения (линии нуклеотидных оснований). На её основе создан метод оптимизации STORM (Sequence-based Toehold Optimization and Redesign Model), позволяющий полностью перепроектировать последовательность тухолда "с чистого листа". Это оптимально для создания сложных биологических инструментов.

    • STORM был дообучен всего на 168 образцах, что ставит под сомнение необходимость создания огромных наборов данных для каждой новой задачи.
  2. Модель на основе обработки естественного языка (NLP) рассматривает каждую последовательность как "фразу", состоящую из паттернов "слов". Её интеграция с CNN-моделью привела к созданию метода оптимизации NuSpeak (Nucleic Acid Speech), который позволяет перепроектировать последние 9 нуклеотидов тухолд свитча, оставляя остальные 21 нуклеотид неизменными. Это полезно для создания детекторов специфических патогенных РНК.

Обе платформы были экспериментально проверены на оптимизации тухолд свитчей, предназначенных для обнаружения фрагментов генома SARS-CoV-2.

  • NuSpeak улучшил производительность сенсоров в среднем на 160%.
  • STORM создал улучшенные версии четырёх плохих сенсоров, чья производительность возросла до 28 раз.

Разработанные инструменты обобщаемы на другие типы РНК-последовательностей, такие как индуцибельные промоторы и природные рибопереключатели, и могут быть применены для решения широкого круга биотехнологических и медицинских задач.